Blog ini pernah membahas pentingnya QA sebelum agent “naik panggung” dan mindset perawatan berkala pasca-launch. Ada satu lapisan yang belum dibahas secara khusus: observability — bagaimana cara memantau apa yang sebenarnya terjadi saat agent sudah berjalan sehari-hari, bukan sekadar tahu “masih hidup atau mati”.
Kenapa “Masih Jalan” Tidak Cukup
Agent yang tidak crash dan terus merespons pesan bukan berarti sedang bekerja dengan baik. Ia bisa saja menjawab pertanyaan dengan kurang tepat, gagal memakai tools yang seharusnya dipanggil, atau merespons lambat karena antrean yang menumpuk — semua ini tidak terlihat kalau ukuran keberhasilan hanya “servernya nyala”.
Beberapa Hal yang Layak Dipantau
- Log percakapan — riwayat interaksi yang bisa ditinjau ulang, terutama untuk kasus yang berujung eskalasi ke manusia atau komplain.
- Tingkat eskalasi — seberapa sering agent “menyerah” dan melempar ke manusia; tren naik bisa jadi sinyal ada jenis pertanyaan baru yang belum tercakup.
- Waktu respons — apakah agent menjawab dalam waktu wajar, atau mulai melambat seiring bertambahnya volume.
- Pola error tools — kalau agent terhubung ke sistem lain (database, API pihak ketiga), kegagalan pemanggilan tools perlu tercatat, bukan hanya “diam” tanpa jejak.
Bedanya dengan QA Pre-Launch
QA sebelum go-live menguji skenario yang sudah diantisipasi — pertanyaan umum, edge case yang terpikirkan tim. Observability pasca-launch menangkap sesuatu yang berbeda: pola nyata dari interaksi pelanggan asli, termasuk skenario yang tidak pernah terpikirkan saat testing. Keduanya saling melengkapi, bukan saling menggantikan.
Tidak Perlu Rumit di Awal
Untuk bisnis kecil-menengah, observability tidak harus berarti dashboard canggih dengan banyak metrik. Titik awal yang realistis: simpan log percakapan secara rapi, tinjau secara berkala (misalnya mingguan) untuk melihat pola pertanyaan yang sering gagal dijawab atau sering dieskalasi. Dari situ, perbaikan bisa diarahkan ke tempat yang benar-benar dibutuhkan, bukan menebak-nebak.
Penutup
Memantau AI agent setelah live adalah kelanjutan alami dari mindset perawatan berkala — bedanya, observability memberi data konkret tentang apa yang perlu dirawat, bukan sekadar asumsi bahwa “sudah lama tidak dicek, mungkin perlu dilihat lagi”.