Benchmark · math

FrontierMath

20 条结果 15 个模型

FrontierMath 是 Epoch AI 推出的基准测试,用于衡量 AI 模型解决极其困难、原创且达到科研水平的数学问题的能力。分数是模型正确解答问题的百分比,目前的模型只能解出很小一部分,远未达到饱和。

了解更多
示例
一道此前从未公开发表的题目,取自数论、代数几何或组合数学等高级领域,其求解需要深厚的专业知识,并最终归结为一个确定的答案(例如某个具体的整数或精确的数学对象)。
评分方式
指标是准确率(accuracy):最终答案与参考答案完全一致的题目所占的比例,以百分比表示。
验证方式
每道题都有唯一确定、可自动核验的答案,只有与参考答案完全一致时才算通过;题目由数学专家精心设计,几乎无法靠猜测蒙对。
为何重要
由于题目都是全新的,它能抵御死记硬背,而且至今仍远未被攻克,因此它是少数几个仍能清晰区分真正高级数学推理与模式匹配的数学基准之一。
示例解析
任务
求满足 $0 \le n < 3^{13}$ 且中心二项式系数 $\binom{2n}{n}$ 不能被 $3$ 整除的整数 $n$ 的个数。
解答
由 Kummer 定理,$3 \nmid \binom{2n}{n}$ 当且仅当在 3 进制下做加法 $n+n$ 时没有进位,即 $n$ 的每一位 3 进制数字都是 0 或 1。在 $0 \le n < 3^{13}$ 范围内,这相当于 13 位数字每位有 2 种选择,所以个数为 $2^{13} = 8192$。
解析
Kummer 定理给出 $v_3\binom{2n}{n}$ 等于在 3 进制下把 $n$ 与自身相加时的进位次数;无进位要求每一位 3 进制数字为 0 或 1,即 13 位数字每位 2 种选择。评分:自动检查器对唯一的最终整数(8192)做精确匹配。
0 14 28 42 56 2024-11-08 2025-08-01 2026-04-25 Claude 3.5 Sonnet · 2 · 2024-11-08 Gemini 1.5 Pro · 2 · 2024-11-08 GPT-4o · 2 · 2024-11-08 o1-preview · 2 · 2024-11-08 o3 · 25 · 2024-12-20 o3 · 25 · 2024-12-22 o3 · 25.2 · 2025-01-19 o3 · 25 · 2025-01-29 o3 · 10 · 2025-04-20 o3-mini with high reasoning and a Python tool · 32 · 2025-03-17 Gemini 2.5 Deep Think · 29 · 2025-10-09 GPT-5 Pro · 13 · 2025-10-13 Claude 4.5 Opus · 21 · 2025-12-04 Gemini 3 Pro · 38 · 2025-12-04 GPT-5.2 Thinking · 40.3 · 2025-12-11 GPT-5.2 Pro · 31 · 2026-01-23 GPT-5.5 Pro · 39.6 · 2026-04-23 GPT-5.5 · 35.4 · 2026-04-23 GPT-5.5 · 51.7 · 2026-04-25 OpenAI o3 · 25.2 · 2024-12-20
Claude 3.5 Sonnet Gemini 1.5 Pro GPT-4o o1-preview o3 o3-mini with high reasoning and a Python tool Gemini 2.5 Deep Think GPT-5 Pro Claude 4.5 Opus Gemini 3 Pro GPT-5.2 Thinking GPT-5.2 Pro GPT-5.5 Pro GPT-5.5 OpenAI o3
时间线
日期 模型 得分 来源
2026-04-25 GPT-5.5 51.7% OpenAI发布GPT-5.5,一款从头重新训练、原生支持全模态处理的模型
2026-04-23 GPT-5.5 Pro 39.6% OpenAI发布具备智能体能力的GPT-5.5,API定价翻倍
2026-04-23 GPT-5.5 35.4% OpenAI发布具备智能体能力的GPT-5.5,API定价翻倍
2026-01-23 GPT-5.2 Pro 31.0% GPT-5.2 Pro 在 FrontierMath Tier 4 上得分 31%
2025-12-11 GPT-5.2 Thinking 40.3% OpenAI 发布 GPT-5.2 Pro 和 Thinking 模型,助力科学与数学
2025-12-04 Claude 4.5 Opus 21.0% Epoch AI 推出前沿数据中心中心并分析 OSWorld 基准
2025-12-04 Gemini 3 Pro 38.0% Epoch AI 推出前沿数据中心中心并分析 OSWorld 基准
2025-10-13 GPT-5 Pro 13.0% GPT-5 Pro 解决 FrontierMath Tier 4 新问题,领先 Gemini 2.5 Deep Think
2025-10-09 Gemini 2.5 Deep Think 29.0% Epoch AI 评估 Gemini 2.5 Deep Think 的数学能力
2025-04-20 o3 10.0% OpenAI的o3在FrontierMath上的得分低于最初声称的水平
2025-03-17 o3-mini with high reasoning and a Python tool 32.0% Epoch对o3-mini在FrontierMath上的评估结果为11%,而OpenAI为32%
2025-01-29 o3 25.0% OpenAI的o3模型在Frontier Math基准测试中取得25%的成绩
2025-01-19 o3 25.2% OpenAI在o3创纪录前资助了FrontierMath基准测试
2024-12-22 o3 25.0% OpenAI的o3在FrontierMath高难度数学基准测试中得分25%
2024-12-20 o3 25.0% OpenAI 预览 o3 推理模型,在 ARC AGI 和 Frontier Math 上取得突破
2024-12-20 OpenAI o3 25.2% Epoch AI
2024-11-08 Claude 3.5 Sonnet 2.0% Epoch AI 发布 FrontierMath 基准以评估高级数学推理能力
2024-11-08 Gemini 1.5 Pro 2.0% Epoch AI 发布 FrontierMath 基准以评估高级数学推理能力
2024-11-08 GPT-4o 2.0% Epoch AI 发布 FrontierMath 基准以评估高级数学推理能力
2024-11-08 o1-preview 2.0% Epoch AI 发布 FrontierMath 基准以评估高级数学推理能力