OpenAIは、2025年1月下旬の一般公開に先立ち、AI能力の急速な進歩を示唆する新しいo3推論言語モデルをプレビューした。この発表では、Gemini 1.5 ProやClaude 3.5 Sonnetなどの以前の最先端モデルと比較して、著しいパフォーマンスの飛躍が強調されている。
- o3は、人間の流暢な知能を測定するために設計されたベンチマークであるARC AGI賞の公開セットで85%の閾値を超えた初のモデルである。
- Frontier Mathベンチマークで25%のスコアを達成し、以前の最先端スコアである2%から大幅に向上した。
- Codeforcesでは国際グランドマスターレベルのパフォーマンスを達成し、SWE-Bench-Verifiedでは71.7%のスコアで新たな最先端記録を樹立した。
- OpenAIはまた、審理的整列に関する研究を発表し、o1クラスのモデルが安全性と整列の研究をどのように強化できるかを示した。
これらの結果は、推論モデルが数学やコーディングといった検証可能な領域を超えて価値を提供し始め、AI研究エコシステム全体の進歩を加速させる可能性があることを示唆している。