Microsoft y Hugging Face lanzaron ThinkingBox, un benchmark que evalúa a los agentes de IA calificando su impacto en estados de base de datos aislados en lugar de solo sus llamadas a herramientas o respuestas finales. En 507 flujos de trabajo empresariales con estado ejecutados 20 veces cada uno contra varios modelos LLM, el estudio encontró que, aunque muchos agentes producen llamadas a herramientas válidas, frecuentemente dejan valores incorrectos, efectos extra no deseados o efectos requeridos faltantes en el backend.
- Claude Opus 5.5 lidera globalmente con una puntuación pass@1 del 67.16%, pero solo tres modelos retienen la mayoría de sus puntuaciones de intento único a lo largo de las 20 repeticiones: GPT-6 Astra (78%), Claude Opus 5.5 (71%) y Claude Opus 5 (71%).
- Kimi-K3 resuelve la cobertura más amplia de tareas (93.89% al menos una vez) pero está entre los menos consistentes, teniendo éxito en las 20 intentos solo para el 13.41% de las tareas.
- GPT-5.6 Sol ofrece el menor costo por intento exitoso de tarea a $0.127, mientras que GPT-5.4 es la opción más barata y confiable a $6.80 por tarea aprobada en las 20 intentos.
- Aproximadamente cuatro de cada cinco fallos se atribuyen a problemas de manejo de herramientas, como fallar al recuperarse de errores o búsquedas vacías, en lugar de déficits de razonamiento.
Los autores argumentan que las puntuaciones pass@1 por sí solas son insuficientes para la fiabilidad de despliegue y recomiendan tratar la tasa de consistencia 20/20 como un insumo de diseño, verificando el estado terminal antes de comprometer cambios en producción.