Epoch AIが公開した独立ベンチマーク結果によると、OpenAIのパブリックリリース版o3モデルはFrontierMathデータセットで約10%のスコアを獲得し、同社が12月の発表時に強調していた25%超のスコアを大幅に下回った。

  • Epoch AIはFrontierMathベンチマークの更新版を使用してリリースされたo3モデルを評価し、約10%のスコアを確認した。
  • OpenAIの当初主張する25%超のスコアは、パブリックリリースよりも強力な内部スケール上で、積極的なテスト時の計算設定を用いて達成された。
  • ARC Prize Foundationは、公開版o3がチャットや製品用途向けにチューニングされており、彼らがテストしたプレビュー版よりも小さい計算層であることを確認した。
  • OpenAIの技術スタッフは、生産モデルは最大のベンチマークパフォーマンスではなく、コスト効率と速度のために最適化されていると述べた。

この乖離は、第三者ベンチマークを検証することの重要性を浮き彫りにし、リリースされたモデルがピークの学術スコアよりも現実的な実用性を優先していることを明確にしている。