Setelah AI agent mulai dipakai untuk menjawab pelanggan atau membantu pekerjaan internal, muncul pertanyaan lanjutan yang sering terlewat: bagaimana cara tahu jawabannya benar-benar bagus? Berbeda dari software biasa yang keluarannya pasti (input sama, output sama), agent berbasis AI bisa memberi jawaban yang sedikit berbeda tiap kali, sehingga butuh cara evaluasi yang berbeda pula.
Kenapa “kelihatannya oke” saja tidak cukup
Mencoba agent beberapa kali dan melihat hasilnya lancar bisa memberi rasa aman yang keliru. Masalah biasanya muncul di kasus-kasus tepi (edge case) — pertanyaan yang ambigu, permintaan di luar cakupan yang seharusnya, atau situasi yang jarang terjadi tapi berdampak besar kalau dijawab salah.
Beberapa cara sederhana menilai kualitas jawaban agent
- Kumpulkan contoh pertanyaan nyata — bukan pertanyaan buatan sendiri, tapi pertanyaan yang benar-benar pernah diajukan pelanggan atau tim, termasuk yang aneh atau di luar dugaan.
- Cek konsistensi jawaban — ajukan pertanyaan yang sama dengan gaya bahasa berbeda, lalu lihat apakah jawabannya tetap konsisten secara substansi.
- Uji batas kewenangan — coba minta agent melakukan sesuatu di luar cakupannya, dan pastikan agent menolak atau eskalasi dengan wajar, bukan memaksakan jawaban.
- Libatkan orang yang bukan pembuat agent — pembuat agent cenderung menguji dengan cara yang “aman” karena sudah tahu batasannya; orang lain biasanya menemukan celah yang berbeda.
Evaluasi bukan pekerjaan sekali jalan
Kualitas jawaban agent perlu dicek ulang secara berkala, terutama setelah ada perubahan pada data, kebijakan bisnis, atau instruksi yang diberikan ke agent. Sesuatu yang bekerja baik bulan lalu tidak otomatis tetap baik setelah ada perubahan di sekitarnya.
Menyisihkan waktu untuk evaluasi rutin, meski sederhana, jauh lebih murah dibanding menanggung dampak dari jawaban yang salah di depan pelanggan atau dalam keputusan bisnis.