ChatGPT、Claude、Geminiの監査により、API評価指標が展開されたチャットボットインターフェースに信頼性を持って移行できないことが明らかになりました。研究では、「文脈妥当性ギャップ」が特定され、APIベースの測定が実際の使用と体系的に異なることが示されています。

  • API評価は、インターフェース評価よりも正確性が3.4パーセントポイント高いスコアを示します。
  • テスト再検信頼性は、インターフェースアクセスと比較してAPIアクセスで2.1パーセントポイント高いです。
  • ChatGPTの場合、インターフェースに切り替えることによるパフォーマンスの低下は、GPT 5.3とGPT 5.4の差を超えています。
  • APIコントロールを通じてシステムプロンプト、サンプリングパラメータ、推論設定を調整しても、このパフォーマンスギャップを信頼性を持って解消することはできません。

これらの知見は、展開されたシステムの代理としてAPI評価を使用することを複雑にし、ベンチマークスコアが実際のユーザー向け能力を過大評価している可能性を示しています。