독립 연구자가 KavachBench를 게시했습니다. 이는 GitHub issue 페이로드에서 파생된 42개의 악성 도구 호출 액션 코퍼스에 대한 IssueTrojanBench의 Kavach AI 코딩 에이전트 가드레일을 평가하는 벤치마크입니다.
- 평가는 4개 카테고리의 42개 공격 액션을 포함하는 IssueTrojanBench의 실제 프롬프트 주입 코퍼스를 사용했습니다.
- 결과는 커버리지 기본 거부 정책 하에서 어댑터 정규화를 통해 달성되며 벤치마크별 정책 튜닝을 통해서가 아님을 보여주었습니다.
- 연구 허들과 논문은 추가 검토를 위해 Zenodo 및 GitHub에서 사용할 수 있습니다.
이 발견들은 유사한 가드레일을 평가할 때 정규화 기반 강제와 특정 튜닝을 구분하는 것의 중요성을 강조합니다.