OpenAI 发布了其下一代推理模型 o3,该模型在推理、编码和数学问题解决方面创下了新纪录。该模型在半私有的 ARC-AGI eval 评估中,低计算模式下得分为 75.7%,高计算模式下得分为 87.5%。
- o3 在 ARC-AGI(低计算)上得分 75.7%,在(高计算)上得分 87.5%,超过了 85% 的人类水平阈值。
- 它在 2024 年美国数学奥林匹克竞赛 (AIME) 上获得 96.7% 的分数,在 EpochAI 的 Frontier Math Benchmark 上获得 25.2% 的分数。
- 在编程方面,o3 在 SWE-Bench Verified 上得分为 71.7(比 o1 高出 22.8 分),在 Codeforces 上的 Elo 评级为 2,727。
- 该模型的上下文窗口为 128K tokens,其运行成本显著高于之前的版本。