OpenAIは新しいo3モデルを発表し、このモデルは生成AIのこれまでの平均2%から大幅に跳ね上がったFrontier Mathベンチマークで25%のスコアを達成しました。この結果は、AIの数学的推論能力の急速な向上を示しています。
- Frontier Mathは、暗記されたデータに依存せずに人間のような能力をテストするために設計された、挑戦的な数学の問題からなるプライベートベンチマークです。
- o3モデルは反復的思考チェーンを使用し、回答する前に自身の推論ステップを評価して修正することができます。
- このプロセスには大量の計算が必要で、個別の問題への回答には1000ドル以上かかるものもあります。
- Google DeepMindのAlphaProofなどの専用モデルとは異なり、o3は高度な数学的スキルを示す汎用AIです。
記事では、コストが低下しスコアが向上すれば、AI数学者が現在人間の専門家の不足によって制限されている検証プロセスを自動化することで、形式手法を変革する可能性があると示唆されています。