Microsoft e Hugging Face lançaram o ThinkingBox, um benchmark que avalia agentes de IA ao classificar seu impacto em estados isolados de banco de dados, em vez de apenas suas chamadas de ferramentas ou respostas finais. Em 507 fluxos de trabalho empresariais com estado executados 20 vezes cada contra vários modelos LLM, o estudo descobriu que, embora muitos agentes produzam chamadas de ferramentas válidas, eles frequentemente deixam valores incorretos, efeitos extras não intencionais ou efeitos obrigatórios ausentes no backend.

  • Claude Opus 5.5 lidera geral com uma pontuação pass@1 de 67,16%, mas apenas três modelos mantêm a maioria de suas pontuações de tentativa única ao longo de 20 repetições: GPT-6 Astra (78%), Claude Opus 5.5 (71%) e Claude Opus 5 (71%).
  • Kimi-K3 resolve a maior cobertura de tarefas (93,89% pelo menos uma vez), mas está entre os menos consistentes, tendo sucesso em todas as 20 tentativas apenas para 13,41% das tarefas.
  • GPT-5.6 Sol oferece o menor custo por tentativa bem-sucedida de tarefa em $0,127, enquanto GPT-5.4 é a opção mais barata e confiável em $6,80 por tarefa passada em todas as 20 tentativas.
  • Aproximadamente quatro em cinco falhas são atribuídas a problemas de manipulação de ferramentas, como falha na recuperação de erros ou consultas vazias, em vez de déficits de raciocínio.

Os autores argumentam que as pontuações pass@1 sozinhas são insuficientes para confiabilidade de implantação e recomendam tratar a taxa de consistência 20/20 como um insumo de design, verificando o estado terminal antes de confirmar alterações em produção.