نشر باحث مستقل KavachBench، وهو معيار تقييم لحاجز الأمان لوكيل البرمجة بالذكاء الاصطناعي Kavach ضد مجموعة IssueTrojanBench المكونة من 42 إجراءً ضارًا لاستدعاء الأدوات المشتقة من حمولات قضايا GitHub.
- استخدم التقييم مجموعة حقن الموجه الحقيقية من IssueTrojanBench والتي تحتوي على 42 إجراء هجوم عبر 4 فئات.
- أظهرت النتائج أن التغطية تتحقق من خلال توحيد المحول تحت سياسة الرفض الافتراضي بدلاً من ضبط السياسة الخاصة بالمعيار.
- تتوفر بيئة البحث والورقة على Zenodo و GitHub للمراجعة الإضافية.
تسلط النتائج الضوء على أهمية التمييز بين التنفيذ القائم على التوحيد والضبط المحدد عند تقييم حواجز الأمان المماثلة.