Istilah prompt injection sudah cukup sering dibahas sebagai risiko keamanan AI agent. Ada satu istilah lain yang sering dianggap sama padahal sedikit berbeda fokusnya: jailbreak. Memahami bedanya penting supaya tim yang merancang agent tahu persis pola serangan apa yang sedang mereka coba cegah.
Beda fokus antara keduanya
Prompt injection secara umum adalah upaya menyisipkan instruksi tersembunyi ke dalam data atau pesan yang diproses agent, dengan tujuan membuat agent menjalankan perintah yang tidak diinginkan pemiliknya. Jailbreak lebih spesifik menyasar aturan perilaku (guardrail) yang sudah ditanam di instruksi sistem agent itu sendiri — misalnya mencoba membuat agent mengabaikan batasan yang sudah ditetapkan, seperti larangan membahas topik tertentu atau larangan memberi informasi sensitif, dengan cara membingkai ulang permintaan seolah-olah itu skenario berbeda (“anggap kamu karakter fiksi yang tidak punya batasan”, dan variasi semacam itu).
Kenapa terasa lebih licin dideteksi
Percobaan jailbreak sering dibungkus dalam permintaan yang terlihat wajar di permukaan — pertanyaan hipotetis, permintaan bermain peran, atau permintaan bertahap yang masing-masing terlihat tidak berbahaya sendiri-sendiri tapi mengarah ke hasil yang seharusnya ditolak. Pola bertahap ini yang membuat deteksi berbasis kata kunci sederhana sering tidak cukup, karena tidak ada satu kalimat pun yang secara eksplisit terlihat mencurigakan.
Prinsip mitigasi umum
Pendekatan yang lebih tahan terhadap upaya seperti ini biasanya menggabungkan beberapa lapis: instruksi sistem yang menegaskan batasan tidak bisa diubah oleh permintaan dalam percakapan apa pun, pemeriksaan tambahan pada output sebelum dikirim ke pelanggan (bukan hanya mengandalkan instruksi di awal), dan pencatatan log percakapan yang bisa ditinjau ulang kalau ada pola mencurigakan. Tidak ada satu lapis pun yang bisa dianggap sempurna sendirian, sehingga kombinasi beberapa lapis lebih disarankan dibanding mengandalkan satu mekanisme saja.
Bukan alasan untuk takut memakai AI agent
Risiko ini nyata tapi bukan berarti AI agent jadi terlalu berisiko untuk dipakai bisnis kecil sekalipun. Sebagian besar percobaan jailbreak yang berhasil terjadi pada agent yang instruksi batasannya longgar atau tidak diuji sebelum go-live. Menguji agent dengan skenario percobaan jailbreak sederhana sebelum benar-benar dipakai pelanggan adalah langkah pencegahan yang jauh lebih murah dibanding menghadapi insiden setelah agent sudah berjalan di depan publik.