Epoch AI 推出了 FrontierMath,这是一个由数百个原创、专家精心设计的数学问题组成的基准测试,旨在评估 AI 系统的高级推理能力。该基准与包括菲尔兹奖得主在内的 60 多位数学家合作开发,问题涵盖数论和代数几何等现代研究领域,通常需要专家花费数小时或数天才能解决。
- 该基准包含“防猜测”且可通过计算自动验证的问题。
- 对 Claude 3.5 Sonnet 和 GPT-4o 等六个领先模型的评估显示,尽管有广泛的支持框架,但没有任何模型能解决超过 2% 的问题。
- 这种表现与 GSM-8K 等基准形成鲜明对比,在 GSM-8K 中,顶级模型的准确率超过 90%。
- Epoch AI 计划定期进行评估,扩展该基准,并在未来几个月发布更多问题。
FrontierMath 旨在为 AI 系统进步过程中研究级数学推理的进展提供标准化衡量标准,突显了当前 AI 能力与专家数学家之间的巨大差距。