Benchmark · math
AIME 2025
AIME 2025 用 2025 年 American Invitational Mathematics Examination(一项高难度的高中数学竞赛)的 15 道题来测试模型的高级数学推理能力。每道题的答案都是 0 到 999 之间的整数,模型的得分是正确解出题目的百分比(通常以 pass@1 或 avg@k 的形式报告)。
了解更多
- 示例
- 典型题目是一道有挑战性的竞赛题——例如数论或组合数学问题——其答案是 0 到 999 之间的单个整数,比如求满足给定一组代数条件的有序数对的数量。
- 评分方式
- 15 道题中的每一道都按整数答案是否完全匹配来评分,得分即正确解出的比例(百分比);由于每次运行答案会有波动,结果通常在多次采样上取平均(avg@k)或以 pass@1 报告。
- 验证方式
- 验证是自动且客观的:将模型给出的最终整数与官方答案对照,没有部分分,也没有人工评判,因此只有数值完全匹配时解答才被接受。
- 为何重要
- AIME 题目要求多步骤的创造性推理而非死记硬背,因此该基准是衡量前沿 LLM 数学能力的广受关注的指标,也是新推理模型发布时常见的醒目数据。
示例解析
任务
AIME 风格的代表性题目(答案是 0 到 999 之间的整数):求所有使 √(n² + 85n + 2017) 为整数的正整数 n 之和。
解答
配方:(2m)² − (2n+85)² = 843 = 3·281。分解平方差:(2m−2n−85)(2m+2n+85) = 843,得 n = 168 或 n = 27。和 = 168 + 27 = 195。
解析
配方将条件化为平方差 (2m)² − (2n+85)² = 843 = 3·281,其唯一的正因数分解给出 n = 168 和 n = 27,两者之和为 195。AIME 按唯一整数答案(0–999)的精确匹配评分,没有部分分。