MicrosoftとHugging Faceは、ThinkingBoxをリリースした。これは、ツール呼び出しや最終的な応答だけでなく、分離されたデータベース状態への影響を採点することでAIエージェントを評価するベンチマークである。507のステートフルなビジネスワークフローを各種LLMモデルに対してそれぞれ20回実行したところ、多くのエージェントが有効なツール呼び出しを行うものの、バックエンドに誤った値、意図しない追加効果、または必要な効果が欠落した状態を残す頻度が高いことが研究で明らかになった。
- Claude Opus 5.5は全体で67.16%のpass@1スコアを記録し首位だが、20回の反復にわたって単一試行のスコアの大部分を維持できるモデルはわずか3つだけである:GPT-6 Astra(78%)、Claude Opus 5.5(71%)、Claude Opus 5(71%)。
- Kimi-K3は最も広範なタスクカバレッジ(少なくとも1回は93.89%)を達成しているが、一貫性という点では低い方であり、20回の試行すべてで成功するのはタスクの13.41%にすぎない。
- GPT-5.6 Solは、成功したタスク試行あたりのコストが$0.127と最も低く、GPT-5.4は20回の試行すべてでタスクをパスする信頼性の高いオプションとして最も安価($6.80)である。
- 失敗の約4分の3は、エラーからの回復不能や空の結果による検索など、ツール処理の問題に起因しており、推論能力の欠如ではない。
著者らは、pass@1スコアだけではデプロイメントの信頼性に不十分であり、20/20の一貫性率を設計上の入力として扱い、本番環境で変更をコミットする前にターミナル状態を確認することを推奨している。