벤치마크 · math

AIME 2024

30 결과 27 모델

AIME 2024는 2024년 American Invitational Mathematics Examination의 15개 문제로 모델의 고급 수학적 추론 능력을 측정하고, 정확히 푼 문제의 비율을 보고합니다.

자세히 보기
예시
전형적인 문제는 고등학교 수준의 어려운 경시 문제로, 예를 들어 정수론이나 조합론 문제이며 답은 하나의 정수입니다(AIME의 답은 항상 정수이며 보통 0에서 999 사이).
채점 방식
지표는 정확도로, 15개 문제 중 맞힌 비율을 나타냅니다. 따라서 한 문제를 맞힐 때마다 전체 점수의 1/15에 해당합니다.
검증 방식
결과는 정확 일치로 인정됩니다. 모델의 최종 정수 답이 공식 정답과 같아야 하며, 자동으로 확인되고 부분 점수나 사람 평가는 없습니다.
왜 중요한가
여러 단계의 추론이 필요한 어렵고 최신의 경시 문제로 이루어진 간결한 집합이라 최전선 모델을 비교하는 데 널리 쓰이며, 문제가 최신이라 학습 데이터 오염 위험이 줄어듭니다.
예제 풀이
문제
600 이하의 양의 정수 n 중에서 4 또는 6으로 나누어떨어지지만 5로는 나누어떨어지지 않는 것은 몇 개입니까? (AIME 답은 0부터 999까지의 정수입니다.)
해답
Multiples of 4 or 6 that are ≤ 600: 150 + 100 − 50 = 200. Of these, the ones also divisible by 5 (multiples of 20 or 30, minus 60): 30 + 20 − 10 = 40. Answer: 200 − 40 = 160.
풀이
포함-배제 원리에 의해 4 또는 6으로 나누어떨어지는 수는 200개이고, 그중 40개는 5로도 나누어떨어지므로 160개가 남습니다. AIME는 최종 정수 답(0–999)만 자동 채점하며 부분 점수는 없습니다.
0 25 50 75 100 2024-09-12 2025-08-09 2026-07-07 o1 · 13.9 · 2024-09-12 OpenAI o1-preview · 83 · 2024-10-01 QwQ-32B-Preview · 50 · 2024-11-28 o3 · 96.7 · 2024-12-20 o3 · 96.7 · 2026-03-25 DeepSeek-R1-Distill-Qwen-7B · 55.5 · 2025-01-22 DeepSeek-R1-Zero · 71 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 72.6 · 2025-01-22 DeepSeek-R1 · 79.8 · 2025-01-22 s1-32B · 57 · 2025-01-31 s1-32B · 57 · 2025-01-31 LIMO · 57.1 · 2025-02-05 Grok 3 mini · 95.8 · 2025-02-19 Claude 3.7 Sonnet · 80 · 2025-02-24 GPT-4.5 · 36.7 · 2025-03-05 DeepSeek-V3-0324 · 59.4 · 2025-03-24 Gemini 2.5 Pro · 92 · 2025-03-26 Seed1.5-Thinking · 86.7 · 2025-04-10 o4-mini · 93.4 · 2025-04-17 Qwen3-235B-A22B · 85.7 · 2025-05-14 Deepseek-R1-0528-Qwen3-8B · 86 · 2025-05-30 Deepseek-R1-0528 · 91.4 · 2025-05-30 Magistral Small · 70.7 · 2025-06-10 Magistral Medium · 73.6 · 2025-06-10 Magistral Medium · 50 · 2025-06-12 GLM-4.5 · 91 · 2025-08-06 GLM-4.5-Air · 89.4 · 2025-08-06 Qwen3-1.7B · 62.4 · 2026-07-07 DeepSeek R1 · 79.8 · 2025-01-20 OpenAI o3 · 91.6 · 2025-04-16
o1 OpenAI o1-preview QwQ-32B-Preview o3 DeepSeek-R1-Distill-Qwen-7B DeepSeek-R1-Zero DeepSeek-R1-Distill-Qwen-32B DeepSeek-R1 s1-32B LIMO Grok 3 mini Claude 3.7 Sonnet GPT-4.5 DeepSeek-V3-0324 Gemini 2.5 Pro Seed1.5-Thinking o4-mini Qwen3-235B-A22B Deepseek-R1-0528-Qwen3-8B Deepseek-R1-0528 Magistral Small Magistral Medium GLM-4.5 GLM-4.5-Air Qwen3-1.7B DeepSeek R1 OpenAI o3
타임라인
날짜 모델 점수 출처
2026-07-07 Qwen3-1.7B 62.4% Direct-OPD는 약한 모델에서 강한 모델로의 RL 이점을 증류하여 더 강력한 모델을 만듭니다
2026-03-25 o3 96.7% OpenAI, ChatGPT에서 o3 은퇴 발표 및 벤치마크 점수 공개
2025-08-06 GLM-4.5 91.0% 지푸 AI가 Claude와 DeepSeek에 맞먹는 GLM-4.5 모델 출시
2025-08-06 GLM-4.5-Air 89.4% 지푸 AI가 Claude와 DeepSeek에 맞먹는 GLM-4.5 모델 출시
2025-06-12 Magistral Medium 50.0% Mistral, 확장 가능한 RL 파이프라인을 갖춘 Magistral 추론 모델 출시
2025-06-10 Magistral Small 70.7% Mistral AI가 오픈 및 기업용 변형과 함께 Magistral 추론 모델을 출시
2025-06-10 Magistral Medium 73.6% Mistral AI가 오픈 및 기업용 변형과 함께 Magistral 추론 모델을 출시
2025-05-30 Deepseek-R1-0528-Qwen3-8B 86.0% DeepSeek, 향상된 추론 및 벤치마크 점수로 R1 모델 업데이트
2025-05-30 Deepseek-R1-0528 91.4% DeepSeek, 향상된 추론 및 벤치마크 점수로 R1 모델 업데이트
2025-05-14 Qwen3-235B-A22B 85.7% Qwen3가 통합 사고 모드와 119개 언어 지원을 도입하다
2025-04-17 o4-mini 93.4% OpenAI가 더 빠르고 저렴한 다중 모달 추론 모델인 o4-mini 출시
2025-04-16 OpenAI o3 91.6% OpenAI
2025-04-10 Seed1.5-Thinking 86.7% Seed1.5-Thinking은 강화학습을 사용하여 추론을 개선합니다
2025-03-26 Gemini 2.5 Pro 92.0% 구글, 100만 토큰 컨텍스트를 지원하는 실험용 Gemini 2.5 Pro 추론 모델 출시
2025-03-24 DeepSeek-V3-0324 59.4% DeepSeek-V3-0324은 DeepSeek-V3 대비 추론, 코딩, 중국어 작문 능력을 향상
2025-03-05 GPT-4.5 36.7% 오픈에이아이, 차트GPT 플러스용 최대 규모 모델 GPT-4.5 출시
2025-02-24 Claude 3.7 Sonnet 80.0% Anthropic, 동적 추론 제어가 가능한 Claude 3.7 Sonnet 출시
2025-02-19 Grok 3 mini 95.8% xAI가 Grok 3 베타 및 DeepSearch 에이전트 출시
2025-02-05 LIMO 57.1% GAIR-NLP, 817개 샘플로 강력한 수학 추론을 달성한 LIMO 출시
2025-01-31 s1-32B 57.0% Simple Scaling Lab가 예산 강제화를 통한 테스트 타임 스케일링으로 s1-32B를 출시
2025-01-31 s1-32B 57.0% s1-32B, 간단한 테스트 타임 스케일링을 통해 경쟁 수학에서 o1-preview를 초과
2025-01-22 DeepSeek-R1-Distill-Qwen-7B 55.5% DeepSeek, 강화학습을 통해 R1 추론 모델 출시
2025-01-22 DeepSeek-R1-Zero 71.0% DeepSeek, 강화학습을 통해 R1 추론 모델 출시
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 72.6% DeepSeek, 강화학습을 통해 R1 추론 모델 출시
2025-01-22 DeepSeek-R1 79.8% DeepSeek, 강화학습을 통해 R1 추론 모델 출시
2025-01-20 DeepSeek R1 79.8% DeepSeek
2024-12-20 o3 96.7% OpenAI, 추론 및 코딩에서 높은 성능을 갖춘 o3 모델 출시
2024-11-28 QwQ-32B-Preview 50.0% Qwen, 실험적 추론 모델 QwQ-32B-Preview 출시
2024-10-01 OpenAI o1-preview 83.0% OpenAI o1과 기타 상위 모델 비교
2024-09-12 o1 13.9% OpenAI가 수학 및 과학 벤치마크에서 인간 전문가를 능가하는 추론 모델 o1-preview 출시