OpenAI宣布了其新的o3模型,该模型在Frontier Math基准测试中取得了25%的成绩,相较于生成式AI此前平均2%的成绩实现了显著飞跃。这一结果突显了AI数学推理能力的快速提升。
- Frontier Math是一个私有的基准测试,包含具有挑战性的数学问题,旨在测试类人能力,而不依赖记忆的数据。
- o3模型使用迭代思维链,使其能够在回答之前评估和纠正自己的推理步骤。
- 此过程需要大量的计算资源,个别问题的解答成本超过1000美元。
- 与Google DeepMind的AlphaProof等专用模型不同,o3是一个通用AI,展现出高级数学技能。
文章指出,如果成本降低且成绩提高,AI数学家可以通过自动化目前受限于人类专家稀缺的验证过程,来变革形式化方法。