OpenAIは、最終回答を提供する前に推論トークンを生成・精緻化することで推論を模倣するように訓練されたo1-previewおよびo1-miniモデルをリリースした。ARC-AGI公開評価データセットでのテストでは、両方のo1バリアントがGPT-4oよりも精度で上回っていることが示されている。
- o1-previewはAnthropicのClaude 3.5 Sonnetと同等の精度を達成するが、タスク完了に約10倍の時間を要する。
- 400件の公開ARC-AGIタスクを解くのにo1には70時間かかった一方、GPT-4oおよびClaude 3.5 Sonnetはわずか30分で完了した。
- これらのモデルは、トレーニング時と推論時の両方で適用されるchain-of-thoughtパラダイムを利用し、強化学習を通じて戦略を精緻化する。
- パフォーマンスはテスト時の計算量に比例してスケールし、精度と使用される推論トークンの数の間には対数線形の関係が見られる。
これらの結果は、テスト時の計算量を増やすことで精度が向上することを示しているが、実用的な応用やベンチマークにおいて効率性が依然として重要な要因であることを浮き彫りにしている。