벤치마크 · math

AIME 2025

31 결과 27 모델

AIME 2025는 어려운 고등학교 수학 경시대회인 2025년 American Invitational Mathematics Examination의 15문제를 사용해 모델의 고급 수학적 추론 능력을 측정합니다. 각 문제의 답은 0에서 999 사이의 정수이며, 모델의 점수는 정확히 푼 문제의 비율(흔히 pass@1 또는 avg@k로 보고)입니다.

자세히 보기
예시
전형적인 문항은 예를 들어 정수론이나 조합론 같은 까다로운 경시 문제로, 그 답은 0에서 999 사이의 단일 정수입니다. 가령 주어진 대수적 조건을 만족하는 순서쌍의 개수를 구하는 식입니다.
채점 방식
15문제 각각을 정수 답의 정확한 일치로 채점하며, 점수는 정확히 푼 비율(백분율)입니다. 답이 실행마다 달라지므로 결과는 보통 여러 샘플에 대해 평균을 내거나(avg@k) pass@1로 보고합니다.
검증 방식
검증은 자동적이고 객관적입니다. 모델이 낸 최종 정수를 공식 정답과 대조하며, 부분 점수도 사람의 판정도 없어서 수치가 정확히 일치할 때만 정답으로 인정됩니다.
왜 중요한가
AIME 문제는 암기가 아니라 여러 단계의 창의적 추론을 요구하기 때문에, 이 벤치마크는 최첨단 LLM의 수학 능력을 가늠하는 널리 주목받는 척도이며 새로운 추론 모델이 출시될 때 자주 등장하는 대표 수치입니다.
예제 풀이
문제
AIME 형식의 대표적인 문제(답은 0에서 999까지의 정수): √(n² + 85n + 2017) 이 정수가 되는 모든 양의 정수 n 의 합을 구하시오.
해답
완전제곱식으로 만들기: (2m)² − (2n+85)² = 843 = 3·281. 제곱의 차를 인수분해: (2m−2n−85)(2m+2n+85) = 843, 따라서 n = 168 또는 n = 27. 합 = 168 + 27 = 195.
풀이
완전제곱식으로 정리하면 조건이 제곱의 차 (2m)² − (2n+85)² = 843 = 3·281 로 바뀌고, 유일한 양의 인수분해가 n = 168 과 n = 27 을 주어 합이 195 이다. AIME 는 단일 정수 답(0–999)의 정확한 일치로 채점하며 부분 점수는 없다.
0 25 50 75 100 2025-01-22 2025-10-17 2026-07-13 Kimi k1.5 (short-CoT) · 60.8 · 2025-01-22 Kimi k1.5 · 77.5 · 2025-01-22 Grok 3 (Think) · 93.3 · 2025-02-19 Grok 3 Beta · 93.3 · 2025-02-26 OpenAI o3-mini · 83.3 · 2025-02-26 DeepSeek R1 · 79.8 · 2025-02-26 Claude 3.7 Sonnet · 61.3 · 2025-02-26 Claude 3.5 Sonnet · 41.3 · 2025-02-26 Grok 3 · 93.3 · 2025-03-11 Gemini 2.5 Pro (experimental) · 86.7 · 2025-03-25 Gemini 2.5 Pro · 86.7 · 2025-03-26 OpenAI o3 · 98.4 · 2025-04-16 OpenAI o4-mini · 99.5 · 2025-04-16 o4-mini · 92.7 · 2025-04-17 Qwen3-235B-A22B · 81.5 · 2025-05-14 DeepSeek-R1-0528 · 87.5 · 2025-05-28 Deepseek-R1-0528 · 87.5 · 2025-05-30 Grok 4 · 88 · 2025-07-25 Kimi K2 · 49.5 · 2025-07-28 Kimi K2 · 49.5 · 2025-07-28 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GLM-4.6 · 93.9 · 2025-09-30 Claude Sonnet 4.5 · 100 · 2025-09-30 Kimi K2.5 · 96.1 · 2026-01-27 o1-pro · 86 · 2026-05-14 DASH · 50.8 · 2026-07-05 Agents-A1 · 79 · 2026-07-06 Mach-Mind-4-Flash · 92.7 · 2026-07-13 Mach-Mind-4-Flash · 92.7 · 2026-07-13
Kimi k1.5 (short-CoT) Kimi k1.5 Grok 3 (Think) Grok 3 Beta OpenAI o3-mini DeepSeek R1 Claude 3.7 Sonnet Claude 3.5 Sonnet Grok 3 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro OpenAI o3 OpenAI o4-mini o4-mini Qwen3-235B-A22B DeepSeek-R1-0528 Deepseek-R1-0528 Grok 4 Kimi K2 GPT-5 GLM-4.6 Claude Sonnet 4.5 Kimi K2.5 o1-pro DASH Agents-A1 Mach-Mind-4-Flash
타임라인
날짜 모델 점수 출처
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: 35B MoE 에이전트 모델이 사후 학습 최적화를 통해 더 큰 모델과 동등한 성능 발휘
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: 35B MoE 에이전트 모델이 사후 훈련 최적화를 통해 더 큰 모델과 동등한 성능 발휘
2026-07-06 Agents-A1 79.0pts 파라미터가 아닌 에이전트 지평 확장: 35B 에이전트로 트릴리언 파라미터 성능 달성
2026-07-05 DASH 50.8% DASH는 세그먼트 수준 신용 할당을 통해 추론 언어 모델의 과잉 사고를 줄입니다
2026-05-14 o1-pro 86.0% OpenAI, 추론 시 컴퓨팅을 통해 추론의 시대를 연 o1 패밀리 출시
2026-01-27 Kimi K2.5 96.1% Moonshot, 에이전트 스웜 기술 탑재 Kimi K2.5 출시
2025-09-30 GLM-4.6 93.9% Zhipu AI, 에이전트 기능과 128k 컨텍스트 윈도우를 갖춘 GLM-4.6 출시
2025-09-30 Claude Sonnet 4.5 100.0% Anthropic, 코딩 및 에이전트 기능 강화된 Claude Sonnet 4.5 출시
2025-08-07 GPT-5 94.6% OpenAI, 적응형 추론과 통합 아키텍처를 갖춘 GPT-5 출시
2025-08-07 GPT-5 94.6% OpenAI가 통합 라우팅과 전문가 수준의 추론을 갖춘 GPT-5를 출시하다
2025-08-07 GPT-5 94.6% OpenAI
2025-07-28 Kimi K2 49.5% Kimi K2: 1조 파라미터와 MuonClip 옵티마이저를 갖춘 오픈 MoE 모델
2025-07-28 Kimi K2 49.5% Moonshot, 32B 활성화 파라미터를 가진 오픈 에이전트 MoE 모델 Kimi K2 출시
2025-07-25 Grok 4 88.0% Epoch AI, Grok 4의 수학 능력 평가
2025-05-30 Deepseek-R1-0528 87.5% DeepSeek, 향상된 추론 및 벤치마크 점수로 R1 모델 업데이트
2025-05-28 DeepSeek-R1-0528 87.5% DeepSeek-R1-0528 추론 및 AIME 정확도 87.5%로 향상
2025-05-14 Qwen3-235B-A22B 81.5% Qwen3가 통합 사고 모드와 119개 언어 지원을 도입하다
2025-04-17 o4-mini 92.7% OpenAI가 더 빠르고 저렴한 다중 모달 추론 모델인 o4-mini 출시
2025-04-16 OpenAI o3 98.4% OpenAI가 에이전트형 도구 사용 기능을 갖춘 o3 및 o4-mini 추론 모델을 출시
2025-04-16 OpenAI o4-mini 99.5% OpenAI가 에이전트형 도구 사용 기능을 갖춘 o3 및 o4-mini 추론 모델을 출시
2025-03-26 Gemini 2.5 Pro 86.7% 구글, 100만 토큰 컨텍스트를 지원하는 실험용 Gemini 2.5 Pro 추론 모델 출시
2025-03-25 Gemini 2.5 Pro (experimental) 86.7% Google DeepMind, Gemini 2.5 Pro 실험 모델 출시
2025-03-11 Grok 3 93.3% xAI, 심층 추론과 백만 토큰 컨텍스트를 갖춘 Grok 3 출시
2025-02-26 Grok 3 Beta 93.3% Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
2025-02-26 OpenAI o3-mini 83.3% Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
2025-02-26 DeepSeek R1 79.8% Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
2025-02-26 Claude 3.7 Sonnet 61.3% Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
2025-02-26 Claude 3.5 Sonnet 41.3% Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
2025-02-19 Grok 3 (Think) 93.3% xAI가 Grok 3 베타 및 DeepSearch 에이전트 출시
2025-01-22 Kimi k1.5 (short-CoT) 60.8% Kimi k1.5는 LLM을 활용한 강화학습 스케일링으로 o1과 동등한 성능을 달성하고 짧은-CoT 모델을 압도한다
2025-01-22 Kimi k1.5 77.5% Kimi k1.5는 LLM을 활용한 강화학습 스케일링으로 o1과 동등한 성능을 달성하고 짧은-CoT 모델을 압도한다