OpenAIは、推論、コーディング、数学的問題解決で新たな記録を樹立した次世代推論モデルo3を発表しました。このモデルは、低計算モードの半非公開ARC-AGI evalで75.7%、高計算モードで87.5%のスコアを達成しました。

  • o3はARC-AGI(低計算)で75.7%、(高計算)で87.5%を獲得し、人間レベルの閾値である85%を上回りました。
  • 2024年アメリカ数学オリンピック(AIME)で96.7%、EpochAIのFrontier Math Benchmarkで25.2%のスコアを達成しました。
  • コーディングでは、o3はSWE-Bench Verifiedで71.7(o1より22.8ポイント高い)、CodeforcesでEloレート2,727を獲得しました。
  • このモデルは128Kトークンのコンテキストウィンドウを持ち、以前のバージョンよりも実行コストが大幅に高いことで知られています。