O Índice de Desperdício de Agentes avaliou 341.054 trajetórias de agentes de 11 conjuntos de dados públicos para identificar ineficiências como loops, tentativas cegas, saída de ferramentas excessiva e execuções abandonadas. A análise revela que comportamentos de loop e tentativa são prevalentes em modelos mais fracos como os agentes Llama, mas raros no Claude 3.7 Sonnet e Qwen3-Coder-480B.

  • A saída de ferramentas excessiva varia significativamente conforme o scaffold, com OpenHands e SWE-agent carregando observações com mais de 20 mil caracteres em mais da metade das execuções.
  • O quinto mais longo de execuções por contagem de etapas consome 40% do custo estimado enquanto resolve a uma taxa menor que o quinto mais curto.
  • O projeto fornece um pipeline e detectores para reconstruir o Índice a partir do hub, com tabelas disponíveis online para verificação da comunidade.

Os autores fornecem mecanismos de correção para publicadores de conjuntos de dados e visam melhorar a transparência no desempenho de agentes de codificação.