OpenAI 的新 o3 系统在 ARC-AGI-1 Public Training 集上训练,在 $10k 计算限制下的 Semi-Private Evaluation 集上得分 75.7%,在高计算配置下得分为 87.5%。

  • 该高效得分符合 ARC-AGI-Pub 规则下的公共排行榜第一名。
  • 测试在两个计算级别进行:高效率为 6 个样本,低效率为 1024 个样本(172 倍计算量)。
  • OpenAI 确认测试版本与官方发布的 o3 不同,后续将更新结果。

ARC Prize 认为这是 AI 能力的显著阶跃式提升,展示了在之前的 GPT 系列模型中未见过的新型任务适应能力。