对 ChatGPT、Claude 和 Gemini 的审计显示,API 评估指标无法可靠地迁移到已部署的聊天机器人界面。该研究识别出一个“上下文有效性差距”,其中基于 API 的测量结果与现实使用情况存在系统性差异。
- API 评估的准确率比界面评估高出 3.4 个百分点。
- 与界面访问相比,API 访问的测试-重测一致性高 2.1 个百分点。
- 对于 ChatGPT,切换到界面的性能下降幅度超过了 GPT 5.3 和 GPT 5.4 之间的差异。
- 通过 API 控制调整系统提示、采样参数和推理设置并不能可靠地消除这一性能差距。
这些发现使将 API 评估作为已部署系统的代理变得复杂,表明基准分数可能夸大了实际面向用户的能力。