벤치마크 · math

MATH-500

saturated 18 결과 17 모델

MATH-500은 경시 수학 데이터셋 MATH에서 500문제를 추린 부분집합으로, 어려운 수학 문제를 푸는 모델의 능력을 평가합니다. 점수는 모델이 최종 답을 맞힌 문제의 비율(백분율)입니다.

자세히 보기
예시
대표적인 문항은 경시대회 수준의 수학 문제로, 예를 들어 여러 단계의 추론을 거쳐 하나의 최종 답(숫자나 닫힌 형태의 식)을 요구하는 대수·기하·정수론 문제입니다.
채점 방식
점수는 500문제 중 모델이 맞힌 비율, 즉 accuracy = 맞힌 최종 답 수 / 500이며 백분율로 나타냅니다.
검증 방식
모델의 최종 답이 기준 정답과 정확히 일치할 때 그 문제를 푼 것으로 간주합니다(중간 과정이 아니라 최종 답에 대한 자동 동치성 검사).
왜 중요한가
수학적 추론을 측정하는 간결하고 널리 쓰이는 척도로, 전체 MATH 세트보다 빠르게 실행되어 추론 모델을 비교할 때 흔히 쓰는 빠른 점검 수단입니다.
예제 풀이
문제
어떤 $k$ 값에 대해 이차방정식 $x^2 - kx + 16 = 0$ 은 양의 정수 근만을 가진다. $k$ 의 서로 다른 가능한 모든 값의 합을 구하여라.
해답
Roots $r,s$: $rs=16$, $k=r+s$. Pairs $(1,16),(2,8),(4,4)\Rightarrow k\in\{17,10,8\}$. Distinct sum $=17+10+8=\boxed{35}$.
풀이
근 $r,s$ 는 $rs=16$ 과 $k=r+s$ 를 만족하는 양의 정수이며, 인수 쌍 $(1,16),(2,8),(4,4)$ 에서 $k=17,10,8$ 이 나오므로 서로 다른 값의 합은 $35$ 이다. MATH-500 은 정규화된 최종 \boxed{} 답의 정확한 일치로 채점하므로 $35$ 만 정답으로 인정된다.
0 25 50 75 100 2024-02-05 2025-04-21 2026-07-07 DeepSeekMath 7B · 51.7 · 2024-02-05 Grok-1.5 · 50.6 · 2024-03-28 Claude 3.5 Sonnet · 71.1 · 2024-06-20 Claude 3.5 Sonnet · 82.2 · 2025-02-26 QwQ-32B-Preview · 90.6 · 2024-11-28 Kimi k1.5 · 96.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 94.6 · 2025-01-22 DeepSeek-R1 · 97.3 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 94.3 · 2025-01-22 LIMO · 94.8 · 2025-02-05 Claude 3.7 Sonnet · 96.2 · 2025-02-26 Gemini 2.0 Flash · 90.9 · 2025-04-15 Phi-4-Mini-Reasoning · 3.2 · 2025-04-30 Llama-8B · 89.1 · 2025-04-30 Qwen-1.5B · 83.9 · 2025-04-30 GLM-4.5 · 98.2 · 2025-08-06 Qwen3.6-27B · 87 · 2026-07-07 Qwen3.6-27B-DFlash · 86 · 2026-07-07
DeepSeekMath 7B Grok-1.5 Claude 3.5 Sonnet QwQ-32B-Preview Kimi k1.5 Kimi k1.5 (short-CoT) DeepSeek-R1 DeepSeek-R1-Distill-Qwen-32B LIMO Claude 3.7 Sonnet Gemini 2.0 Flash Phi-4-Mini-Reasoning Llama-8B Qwen-1.5B GLM-4.5 Qwen3.6-27B Qwen3.6-27B-DFlash
타임라인
날짜 모델 점수 출처
2026-07-07 Qwen3.6-27B 87.0% llama.cpp에 DFlash 병합, Qwen3.6-27B에서 4.44배 속도 향상
2026-07-07 Qwen3.6-27B-DFlash 86.0% llama.cpp에 DFlash 병합, Qwen3.6-27B에서 4.44배 속도 향상
2025-08-06 GLM-4.5 98.2% 지푸 AI가 Claude와 DeepSeek에 맞먹는 GLM-4.5 모델 출시
2025-04-30 Phi-4-Mini-Reasoning 3.2% Microsoft, 더 큰 추론 모델을 능가하는 3.8B 모델 Phi-4-Mini-Reasoning 출시
2025-04-30 Llama-8B 89.1% Microsoft, 더 큰 추론 모델을 능가하는 3.8B 모델 Phi-4-Mini-Reasoning 출시
2025-04-30 Qwen-1.5B 83.9% Microsoft, 더 큰 추론 모델을 능가하는 3.8B 모델 Phi-4-Mini-Reasoning 출시
2025-04-15 Gemini 2.0 Flash 90.9% 구글, Gemini 1.5 Pro보다 두 배 빠른 속도와 향상된 품질의 Gemini 2.0 Flash 출시
2025-02-26 Claude 3.7 Sonnet 96.2% Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
2025-02-26 Claude 3.5 Sonnet 82.2% Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
2025-02-05 LIMO 94.8% GAIR-NLP, 817개 샘플로 강력한 수학 추론을 달성한 LIMO 출시
2025-01-22 Kimi k1.5 96.2% Kimi k1.5는 LLM을 활용한 강화학습 스케일링으로 o1과 동등한 성능을 달성하고 짧은-CoT 모델을 압도한다
2025-01-22 Kimi k1.5 (short-CoT) 94.6% Kimi k1.5는 LLM을 활용한 강화학습 스케일링으로 o1과 동등한 성능을 달성하고 짧은-CoT 모델을 압도한다
2025-01-22 DeepSeek-R1 97.3% DeepSeek, 강화학습을 통해 R1 추론 모델 출시
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 94.3% DeepSeek, 강화학습을 통해 R1 추론 모델 출시
2024-11-28 QwQ-32B-Preview 90.6% Qwen, 실험적 추론 모델 QwQ-32B-Preview 출시
2024-06-20 Claude 3.5 Sonnet 71.1% Anthropic, Claude 3.5 Sonnet의 향상된 코딩 및 비전 벤치마크를 포함한 추가 문서 출시
2024-03-28 Grok-1.5 50.6% xAI, 추론 능력 향상 및 128K 컨텍스트를 갖춘 Grok-1.5 출시
2024-02-05 DeepSeekMath 7B 51.7% DeepSeekMath 7B, GRPO와 선별된 데이터를 사용해 MATH 벤치마크에서 51.7% 달성