एक स्वतंत्र शोधकर्ता ने KavachBench प्रकाशित किया, जो AI कोडिंग एजेंट गार्डरेल Kavach का मूल्यांकन करता है IssueTrojanBench के 42 दुर्भावनापूर्ण टूल-कॉल एक्शन के कॉरपस के खिलाफ, जो GitHub issue पेलोड से व्युत्पन्न हैं।
- मूल्यांकन में IssueTrojanBench के वास्तविक प्रॉम्प्ट-इनजेक्शन कॉरपस का उपयोग किया गया जिसमें 4 श्रेणियों में 42 हमले एक्शन शामिल हैं।
- परिणामों ने दिखाया कि कवरेज डिफ़ॉल्ट-डिनई नीति के तहत एडाप्टर कैनोनिकलाइज़ेशन के माध्यम से हासिल किया जाता है, न कि बेंचमार्क-विशिष्ट नीति ट्यूनिंग के माध्यम से।
- शोध हैंसेस और पेपर आगे की समीक्षा के लिए Zenodo और GitHub पर उपलब्ध हैं।
यह निष्कर्ष सामान्यीकरण-आधारित प्रवर्तन और विशिष्ट ट्यूनिंग के बीच अंतर करने के महत्व को उजागर करते हैं जब समान गार्डरेल का मूल्यांकन किया जाता है।