벤치마크 · math

GSM8K

saturated 11 결과 10 모델

GSM8K(Grade School Math 8K)는 각각 여러 단계의 산술 추론을 거쳐야 풀 수 있는 초등학교 수준의 수학 문장제 벤치마크로, 모델은 최종 숫자 답이 맞은 문제의 비율로 점수를 매깁니다.

자세히 보기
예시
"Natalia가 4월에 친구 48명에게 클립을 팔고 5월에는 그 절반을 팔았다. 모두 몇 개를 팔았나?"와 같은 짧은 문장제로, 모델은 단계를 밟아 최종 숫자를 내놓아야 합니다.
채점 방식
점수는 accuracy(정확도)로, 최종 숫자 답이 참조 답과 정확히 일치하는 문제의 비율입니다. 중간 추론은 채점하지 않고 최종 숫자만 봅니다.
검증 방식
검증은 자동이며 정확 일치 방식입니다. 모델의 최종 숫자를 (보통 "####" 같은 구분자 뒤에서) 뽑아내 정답과 비교하므로 사람의 판단이 필요 없습니다.
왜 중요한가
다단계 추론을 재는 표준적이고 검증이 쉬운 테스트가 되었고, 잘 알려진 chain-of-thought 프롬프트 기법이 이 점수를 크게 끌어올리는 것이 밝혀지면서 추론 능력의 흔한 척도가 되었습니다.
예제 풀이
문제
마리아는 크레용이 24개씩 든 상자 3개를 가지고 있습니다. 동생에게 크레용 15개를 주고, 그다음 가득 찬 상자 2개를 더 삽니다. 이제 마리아는 크레용을 몇 개 가지고 있나요?
해답
3 × 24 = 72; 72 − 15 = 57; 2 × 24 = 48; 57 + 48 = 105 → 105
풀이
곱해서 처음 개수를 구하고, 준 개수를 빼고, 새로 산 상자를 더합니다: 72 − 15 + 48 = 105. GSM8K는 '####' 구분자 뒤에서 추출한 최종 숫자만 정확히 일치하는지로 채점하므로 추론 단계는 평가되지 않고 105만 인정됩니다.
0 25 50 75 100 2023-03-14 2024-11-18 2026-07-26 Grok-1.5 · 90 · 2024-03-28 DUP method · 97.1 · 2024-04-23 Claude 3.5 Sonnet · 91.6 · 2024-06-20 Qwen2-72B · 89.5 · 2024-07-15 Qwen2-72B · 89.5 · 2024-07-15 Falcon3-10B-Base · 83 · 2024-12-17 Falcon3-7B-Base · 79.1 · 2024-12-17 Falcon3-10B-Instruct · 83.1 · 2024-12-17 Gemma-4-12B · 86 · 2026-07-13 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 · 74.2 · 2026-07-26 GPT-4 · 92 · 2023-03-14
Grok-1.5 DUP method Claude 3.5 Sonnet Qwen2-72B Falcon3-10B-Base Falcon3-7B-Base Falcon3-10B-Instruct Gemma-4-12B Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 GPT-4
타임라인
날짜 모델 점수 출처
2026-07-26 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 74.219% CrowdTensor, 자원봉사자 교육 베타 및 Qwen2.5-7B GSM8K 캠페인 초안 RFC 출시
2026-07-13 Gemma-4-12B 86.0% Flint는 정확도를 유지하면서 추론 추적을 압축하여 토큰 사용량을 줄입니다
2024-12-17 Falcon3-10B-Base 83.0% Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시
2024-12-17 Falcon3-7B-Base 79.1% Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시
2024-12-17 Falcon3-10B-Instruct 83.1% Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시
2024-07-15 Qwen2-72B 89.5% Qwen 팀, 72B 밀집 및 MoE 모델이 포함된 Qwen2 시리즈 출시
2024-07-15 Qwen2-72B 89.5% Qwen2 기술 보고서: 최대 72B 규모의 밀집형 및 MoE 모델 소개
2024-06-20 Claude 3.5 Sonnet 91.6% Anthropic, Claude 3.5 Sonnet의 향상된 코딩 및 비전 벤치마크를 포함한 추가 문서 출시
2024-04-23 DUP method 97.1% 문제를 깊이 이해하는 방법이 GSM8K에서 97.1% 달성
2024-03-28 Grok-1.5 90.0% xAI, 추론 능력 향상 및 128K 컨텍스트를 갖춘 Grok-1.5 출시
2023-03-14 GPT-4 92.0% OpenAI