微软与Hugging Face发布了ThinkingBox,这是一个基准测试,通过对孤立数据库状态的影响进行评分来评估AI智能体,而非仅关注其工具调用或最终响应。在对各种大语言模型运行的507个有状态业务流程(每个运行20次)中,研究发现,尽管许多智能体能生成有效的工具调用,但它们经常在后端留下错误的值、意外的额外效果或缺失的必要效果。
- Claude Opus 5.5以67.16%的pass@1得分领先整体表现,但仅有三个模型在20次重复测试中保留了大部分单次尝试的得分:GPT-6 Astra(78%)、Claude Opus 5.5(71%)和Claude Opus 5(71%)。
- Kimi-K3解决了最广泛的任务覆盖范围(至少一次成功率为93.89%),但一致性较差,仅在13.41%的任务中实现了20次尝试全部成功。
- GPT-5.6 Sol以每次成功任务尝试成本最低($0.127)著称,而GPT-5.4则是每次任务在20次尝试中均能成功的最经济可靠选项,成本为$6.80。
- 约五分之四的失败归因于工具处理问题,例如未能从错误或空查询中恢复,而非推理能力不足。
作者认为,仅凭pass@1得分不足以保障部署可靠性,并建议将20/20一致性率作为设计输入,在生产环境提交更改前检查终端状态。