Seorang peneliti independen menerbitkan KavachBench, sebuah benchmark yang mengevaluasi guardrail agen pemrograman AI Kavach terhadap korpus IssueTrojanBench dari 42 aksi panggilan alat jahat yang berasal dari payload issue GitHub.
- Evaluasi menggunakan korpus injeksi prompt nyata IssueTrojanBench yang berisi 42 aksi serangan di 4 kategori.
- Hasil menunjukkan bahwa cakupan dicapai melalui kanonisasi adapter di bawah kebijakan deny default, bukan penyesuaian kebijakan spesifik benchmark.
- Harness penelitian dan makalah tersedia di Zenodo dan GitHub untuk tinjauan lebih lanjut.
Temuan ini menyoroti pentingnya membedakan antara penegakan berbasis kanonisasi dan penyesuaian spesifik saat mengevaluasi guardrail serupa.