Peneliti keamanan AI independen Krishnakaanth Reddy Yeduguru sedang meminta dukungan untuk kategori cs.CR di arXiv untuk sebuah makalah berjudul "RedSOC — Sebuah Kerangka Evaluasi Adversarial untuk Pusat Operasi Keamanan Terintegrasi LLM."
Studi ini menyajikan temuan kunci termasuk tingkat keberhasilan serangan (ASR) 100% untuk injeksi prompt tidak langsung dan ASR 80% untuk pencemaran korpus. Selain itu, lapisan deteksi yang diusulkan mencapai deteksi 100% di 15 skenario dan 10 menjalankan independen tanpa memerlukan internal model.
Penulis menyediakan kode dukungan (3RCVLY) untuk memfasilitasi proses peninjauan di arXiv.