ARC Prize Foundation 发布了其对 OpenAI 的 o3 和 o4-mini 模型在 ARC-AGI 推理基准上的首次公开分析。评估结果显示,尽管这些前沿模型取得了显著进展,但尚未解决困难的 ARC-AGI-2 集合。

  • o3-medium 在 ARC-AGI-1 Semi Private Eval 集合上达到 53%,而 o4-mini-medium 以高效率达到 41%。
  • o3 和 o4-mini 在更具挑战性的 ARC-AGI-2 基准上的得分均低于 3%。
  • 高推理设置由于超时或缺少输出导致覆盖不完整,使得这些结果不适合排行榜报告。
  • 生产环境的 o3 模型与早期的 o3-preview 不同,它整合了视觉输入并使用了不同的训练数据约束。

研究结果表明,ARC-AGI-1 仍然是衡量当前模型能力的敏感工具,而 ARC-AGI-2 则作为缩小人类推理与 AI 推理差距的未来模型的下一代基准。