Microsoft et Hugging Face ont publié ThinkingBox, un benchmark qui évalue les agents IA en notant leur impact sur des états de base de données isolés plutôt que simplement leurs appels d'outils ou leurs réponses finales. Sur 507 workflows métier avec état exécutés 20 fois chacun contre divers modèles LLM, l'étude a révélé que bien que de nombreux agents produisent des appels d'outils valides, ils laissent fréquemment des valeurs incorrectes, des effets secondaires non intentionnels ou des effets requis manquants dans le backend.
- Claude Opus 5.5 domine globalement avec un score pass@1 de 67,16 %, mais seulement trois modèles conservent la majorité de leurs scores à une tentative sur les 20 répétitions : GPT-6 Astra (78 %), Claude Opus 5.5 (71 %) et Claude Opus 5 (71 %).
- Kimi-K3 résout la couverture la plus large de tâches (93,89 % au moins une fois) mais est parmi les moins cohérents, réussissant dans les 20 tentatives pour seulement 13,41 % des tâches.
- GPT-5.6 Sol offre le coût le plus bas par tentative de tâche réussie à 0,127 $, tandis que GPT-5.4 est l'option la moins chère fiable à 6,80 $ par tâche passée sur les 20 tentatives.
- Environ quatre échecs sur cinq sont attribués à des problèmes de gestion des outils, tels que l'incapacité à récupérer des erreurs ou des recherches vides, plutôt qu'à des déficits de raisonnement.
Les auteurs soutiennent que les scores pass@1 seuls sont insuffisants pour la fiabilité du déploiement et recommandent de traiter le taux de cohérence 20/20 comme une entrée de conception, en vérifiant l'état terminal avant de valider les modifications en production.