ARC-AGI-1 Public TrainingセットでトレーニングされたOpenAIの新しいo3システムは、$10kの計算制限内でSemi-Private Evaluationセットで75.7%、高計算構成で87.5%のスコアを記録しました。

  • 高効率スコアはARC-AGI-Pubルールに基づきパブリックリーダーボードで1位として認定されます。
  • テストは2つの計算レベルで実施されました:高効率用6サンプル、低効率用1024サンプル(172倍の計算量)。
  • OpenAIはテストされたバージョンが公式リリースされたo3と異なると確認し、更新された結果は後日公開されます。

ARC PrizeはこれをAI能力の重要なステップ関数的増加と見なし、以前のGPTファミリーモデルでは見られなかった新しいタスク適応能力を示しています。