Независимый исследователь опубликовал KavachBench, бенчмарк для оценки защитного механизма AI-агента по написанию кода Kavach против корпуса из 42 вредоносных действий вызова инструментов из IssueTrojanBench, полученных на основе полезной нагрузки GitHub issue.
- Оценка использовала реальный корпус инъекций промптов IssueTrojanBench, содержащий 42 атакующих действия в 4 категориях.
- Результаты показали, что покрытие достигается за счет канонизации адаптера при политике по умолчанию «deny», а не через настройку политики под конкретный бенчмарк.
- Исследовательский стенд и статья доступны на Zenodo и GitHub для дальнейшего изучения.
Выводы подчеркивают важность различий между принудительным исполнением на основе канонизации и специфической настройкой при оценке подобных защитных механизмов.