Blog ini pernah membahas prompt versioning — kenapa instruksi AI agent perlu dikelola seperti kode software, bukan diedit sembarangan di tempat. Pertanyaan lanjutannya: begitu ada perubahan instruksi yang mau dicoba, bagaimana cara tahu perubahan itu benar-benar memperbaiki, bukan malah memperburuk sesuatu yang selama ini sudah jalan baik? Di sinilah A/B testing prompt masuk — konsep yang sudah lama dipakai di dunia marketing dan produk digital, sekarang mulai relevan juga untuk instruksi agent.
Kenapa “kelihatannya lebih baik” tidak cukup
Godaan paling umum saat mengubah prompt adalah mencobanya di beberapa percakapan, merasa hasilnya lebih baik, lalu langsung menggantinya sepenuhnya. Masalahnya, beberapa percakapan uji coba jarang mewakili keragaman pertanyaan nyata yang masuk setiap hari. Prompt yang terlihat lebih baik untuk pertanyaan sederhana bisa saja membuat agent lebih sering salah untuk kasus yang lebih rumit — dan itu baru ketahuan setelah berjalan ke banyak pelanggan sungguhan, bukan dari beberapa kali uji manual.
Bentuk paling sederhana: jalankan dua versi berdampingan
A/B testing prompt pada dasarnya menjalankan versi lama dan versi baru secara bersamaan untuk sebagian kecil dari total percakapan — bukan mengganti semuanya sekaligus. Sebagian pelanggan (misalnya 10-20 persen dari total) diarahkan ke prompt baru, sisanya tetap memakai versi lama yang sudah terbukti. Setelah data terkumpul cukup banyak, baru dibandingkan: apakah tingkat eskalasi ke manusia berkurang, apakah jawaban lebih sering dianggap membantu, apakah keluhan justru bertambah.
Metrik yang dibandingkan tidak harus rumit
- Frekuensi eskalasi ke manusia — prompt yang baik biasanya menurunkan ini untuk kasus sederhana, tanpa menaikkannya untuk kasus yang memang butuh manusia.
- Panjang percakapan sampai selesai — percakapan yang berputar-putar sering tanda instruksi kurang jelas.
- Keluhan atau koreksi manual dari staf setelah agent menjawab — sinyal paling jujur soal kualitas jawaban.
Tidak semua bisnis punya infrastruktur canggih untuk menjalankan eksperimen berlapis. Versi paling sederhana yang tetap berguna: uji prompt baru selama beberapa hari di jam-jam tertentu atau untuk sebagian kecil pelanggan, catat manual hasilnya, baru putuskan apakah layak diterapkan penuh — jauh lebih aman daripada mengganti instruksi produksi secara langsung berdasarkan firasat.
Perubahan kecil bisa berdampak besar, ke arah manapun
Salah satu hal yang sering mengejutkan tim yang baru mulai serius mengelola prompt: perubahan satu-dua kalimat instruksi kadang mengubah perilaku agent lebih jauh dari yang diperkirakan — nada jawaban jadi lebih kaku, atau agent jadi terlalu sering menolak pertanyaan yang sebenarnya aman dijawab. Ini alasan kenapa pengujian bertahap lebih masuk akal dibanding percaya diri penuh pada satu revisi, sekecil apapun perubahannya terlihat di atas kertas.