ARC Prize Foundationは、ARC-AGI推論ベンチマークにおけるOpenAIのo3およびo4-miniモデルに関する初の公開分析を発表した。この評価により、これらの最先端モデルが著しい進歩を示しているものの、まだ困難なARC-AGI-2セットを解決できていないことが明らかになった。

  • o3-mediumはARC-AGI-1 Semi Private Evalセットで53%のスコアを記録し、o4-mini-mediumは高い効率性で41%に達した。
  • o3とo4-miniの両方とも、より挑戦的なARC-AGI-2ベンチマークで3%未満のスコアにとどまった。
  • 高度な推論設定では、タイムアウトや出力不足によりカバー率が不完全となり、これらの結果はリーダーボードへの報告には適さなかった。
  • 本番環境のo3モデルは、視覚入力を統合し、異なるトレーニングデータの制約を使用することで、以前のo3-previewと異なっている。

この調査結果は、ARC-AGI-1が現在のモデル能力を測定するための敏感なツールであり、ARC-AGI-2が人間の推論とAIの推論のギャップを埋める将来のモデルのための次世代ベンチマークであることを浮き彫りにしている。