ChatGPT、Claude、Geminiの監査により、API評価指標が展開されたチャットボットインターフェースに信頼性を持って移行できないことが明らかになりました。研究では、「文脈妥当性ギャップ」が特定され、APIベースの測定が実際の使用と体系的に異なることが示されています。
- API評価は、インターフェース評価よりも正確性が3.4パーセントポイント高いスコアを示します。
- テスト再検信頼性は、インターフェースアクセスと比較してAPIアクセスで2.1パーセントポイント高いです。
- ChatGPTの場合、インターフェースに切り替えることによるパフォーマンスの低下は、GPT 5.3とGPT 5.4の差を超えています。
- APIコントロールを通じてシステムプロンプト、サンプリングパラメータ、推論設定を調整しても、このパフォーマンスギャップを信頼性を持って解消することはできません。
これらの知見は、展開されたシステムの代理としてAPI評価を使用することを複雑にし、ベンチマークスコアが実際のユーザー向け能力を過大評価している可能性を示しています。