OpenAIは、高度な推論能力とPythonツールアクセスを備えたo3-miniモデルが、FrontierMathベンチマークで32%のスコアを達成したと主張しています。しかし、Epochの公式な独立評価では、大幅に低い11%というスコアが報告されています。

  • Epochはこのベンチマークを構築しており、正確なスコアリングのためのインセンティブがより適切です。
  • OpenAIは最も難しい問題階層で28%のスコアを報告しましたが、これは総合スコアと疑わしいほど近いです。
  • Epochはテストインフラストラクチャとデータに関する広範な情報を公開していますが、OpenAIはほとんど公開していません。
  • 差異の原因は、OpenAIがより強力な内部スケールフォールド、より多くのテスト時計算、または異なる問題のサブセット(180対290)を使用している可能性があります。

結果の違いは、大規模言語モデルのベンチマークにおいて、透明な評価方法論と独立した検証の重要性を浮き彫りにしています。