一位独立研究人员发布了 KavachBench,这是一个基准测试,用于评估 AI 编码代理护栏 Kavach 针对 IssueTrojanBench 语料库中的 42 个恶意工具调用操作,这些操作源自 GitHub issue 的有效载荷。

  • 该评估利用了 IssueTrojanBench 的真实提示注入语料库,其中包含 4 个类别的 42 个攻击操作。
  • 结果表明,覆盖范围是通过在默认拒绝策略下对适配器进行规范化实现的,而不是针对基准测试的策略调整。
  • 研究环境和论文可在 Zenodo 和 GitHub 上供进一步审查。

这些发现强调了在评估类似护栏时区分基于规范化的执行与特定调整的重要性。