Para peneliti memperkenalkan ReasAlign, solusi tingkat model yang dirancang untuk meningkatkan keselarasan keamanan dalam Model Bahasa Besar (LLM) terhadap serangan injeksi prompt tidak langsung. Pendekatan ini mengintegrasikan langkah-langkah penalaran terstruktur untuk menganalisis kueri pengguna dan mendeteksi instruksi yang bertentangan, memastikan kesinambungan tugas yang dimaksudkan oleh pengguna.
- ReasAlign memanfaatkan mekanisme penskalaan saat pengujian dengan model penilai yang dioptimalkan berdasarkan preferensi untuk menilai langkah-langkah penalaran dan memilih lintasan terbaik.
- Pada benchmark CyberSecEval2, ia mencapai utilitas sebesar 94,6% dan hanya memiliki tingkat keberhasilan serangan (ASR) sebesar 3,6%.
- Kinerja ini jauh melampaui Meta SecAlign, yang mencatatkan utilitas 56,4% dan ASR 74,4% pada tugas-tugas yang sama.
Para penulis menyatakan bahwa ReasAlign menetapkan pertahanan yang kuat dan praktis terhadap serangan injeksi prompt dalam sistem agentic dunia nyata dengan mencapai keseimbangan terbaik antara keamanan dan utilitas.