L'indice de gaspillage des agents a évalué 341 054 trajectoires d'agents issues de 11 ensembles de données publics afin d'identifier les inefficacités telles que les boucles, les tentatives aveugles, les sorties d'outils surdimensionnées et les exécutions abandonnées. L'analyse révèle que les comportements de boucle et de réessai sont courants dans les modèles plus faibles comme les agents Llama, mais rares dans Claude 3.7 Sonnet et Qwen3-Coder-480B.
- La taille des sorties d'outils varie considérablement selon l'architecture : OpenHands et SWE-agent conservent des observations de plus de 20 000 caractères dans plus de la moitié des exécutions.
- Le cinquième des exécutions ayant le plus grand nombre d'étapes consomme 40 % du coût estimé tout en étant résolu à un taux inférieur à celui du cinquième des exécutions les plus courtes.
- Le projet fournit un pipeline et des détecteurs pour reconstruire l'indice depuis le hub, avec des tableaux disponibles en ligne pour la vérification par la communauté.
Les auteurs proposent des mécanismes de correction pour les éditeurs d'ensembles de données et visent à améliorer la transparence des performances des agents de codage.