OpenAIは、非開示契約を結んだ状態で独立した数学ベンチマークであるFrontierMathへの資金提供を行った。この契約により、Epoch AIはOpenAIがo3モデルの歴史的なパフォーマンスを発表するまで、この関係を開示することが禁じられていた。60人以上の数学者によって開発されたこのベンチマークは複雑な推論能力をテストするものであり、OpenAIのo3はそれにおいて25.2パーセントの成功率を達成した。

  • FrontierMathは高度な数学的問題解決能力を評価するために2024年11月に導入された。
  • Epoch AIは、12月20日のo3発表までOpenAIの財政支援の開示を禁じる契約を結んだ。
  • ベンチマークの問題は、資金源を知らなかった60人以上の主要な数学者のチームによって作成された。
  • OpenAIはFrontierMathデータの「大部分だがすべてではない」にアクセスしたが、口頭の合意によりモデルトレーニングに資料を使用することは禁止されていた。
  • Epoch AIは透明性の欠如を過ちとして認め、将来の共同作業では資金源に関するより明確な情報を約束する。

この状況は、AIベンチマーキングの複雑さと透明性の重要性、特に数学的推論が言語モデルにとって大きな弱点であるという点を浮き彫りにしている。