OpenAI 预览了其新的 o3 推理语言模型,预示着在 2025 年 1 月下旬公开发布之前 AI 能力将迅速进步。该公告强调了与 Gemini 1.5 Pro 和 Claude 3.5 Sonnet 等之前的最先进模型相比,性能有显著提升。

  • o3 是第一个在 ARC AGI 奖公共数据集上超过 85% 阈值的模型,这是一个旨在衡量人类流体智能的基准测试。
  • 它在 Frontier Math 基准测试中取得了 25% 的成绩,较之前最先进水平的 2% 有大幅增长。
  • 该模型在 Codeforces 上达到国际特级大师水平,并在 SWE-Bench-Verified 上创下 71.7% 分数的新纪录。
  • OpenAI 还发布了关于深思熟虑对齐(deliberative alignment)的研究,展示了 o1 级模型如何增强安全性和对齐研究。

这些结果表明,推理模型开始超越数学和编码等可验证领域,提供价值,并可能加速整个 AI 研究生态系统的进步。