Um pesquisador independente publicou o KavachBench, um benchmark que avalia a barreira de segurança do agente de codificação com IA Kavach contra o corpus do IssueTrojanBench de 42 ações maliciosas de chamada de ferramentas derivadas de payloads de issues do GitHub.

  • A avaliação utilizou o corpus real de injeção de prompt do IssueTrojanBench contendo 42 ações de ataque em 4 categorias.
  • Os resultados demonstraram que a cobertura é alcançada por meio da canonização do adaptador sob uma política de negação padrão, em vez de ajuste específico do benchmark.
  • O ambiente de pesquisa e o artigo estão disponíveis no Zenodo e no GitHub para revisão adicional.

As descobertas destacam a importância de distinguir entre aplicação baseada em canonização e ajuste específico ao avaliar barreiras de segurança semelhantes.