独立した研究者が KavachBench を公開しました。これは、GitHub issue ペイロードから派生した 42 の悪意あるツール呼び出しアクションの_corpus_である IssueTrojanBench に対して、AI コーディングエージェントのガードレール Kavach を評価するためのベンチマークです。
- 評価では、4つのカテゴリにわたる42の攻撃アクションを含む IssueTrojanBench の実プロンプト注入コーパスが利用されました。
- 結果は、カバレッジがベンチマーク固有のポリシー調整ではなく、デフォルト拒否ポリシーの下でのアダプタの正規化によって達成されることを示しました。
- 研究ハーネスと論文は、さらなるレビューのために Zenodo と GitHub で入手可能です。
これらの知見は、同様のガードレールを評価する際に、正規化ベースの強制と特定の調整を区別することの重要性を強調しています。