벤치마크 · math
GSM8K
GSM8K(Grade School Math 8K)는 각각 여러 단계의 산술 추론을 거쳐야 풀 수 있는 초등학교 수준의 수학 문장제 벤치마크로, 모델은 최종 숫자 답이 맞은 문제의 비율로 점수를 매깁니다.
자세히 보기
- 예시
- "Natalia가 4월에 친구 48명에게 클립을 팔고 5월에는 그 절반을 팔았다. 모두 몇 개를 팔았나?"와 같은 짧은 문장제로, 모델은 단계를 밟아 최종 숫자를 내놓아야 합니다.
- 채점 방식
- 점수는 accuracy(정확도)로, 최종 숫자 답이 참조 답과 정확히 일치하는 문제의 비율입니다. 중간 추론은 채점하지 않고 최종 숫자만 봅니다.
- 검증 방식
- 검증은 자동이며 정확 일치 방식입니다. 모델의 최종 숫자를 (보통 "####" 같은 구분자 뒤에서) 뽑아내 정답과 비교하므로 사람의 판단이 필요 없습니다.
- 왜 중요한가
- 다단계 추론을 재는 표준적이고 검증이 쉬운 테스트가 되었고, 잘 알려진 chain-of-thought 프롬프트 기법이 이 점수를 크게 끌어올리는 것이 밝혀지면서 추론 능력의 흔한 척도가 되었습니다.
예제 풀이
문제
마리아는 크레용이 24개씩 든 상자 3개를 가지고 있습니다. 동생에게 크레용 15개를 주고, 그다음 가득 찬 상자 2개를 더 삽니다. 이제 마리아는 크레용을 몇 개 가지고 있나요?
해답
3 × 24 = 72; 72 − 15 = 57; 2 × 24 = 48; 57 + 48 = 105 → 105
풀이
곱해서 처음 개수를 구하고, 준 개수를 빼고, 새로 산 상자를 더합니다: 72 − 15 + 48 = 105. GSM8K는 '####' 구분자 뒤에서 추출한 최종 숫자만 정확히 일치하는지로 채점하므로 추론 단계는 평가되지 않고 105만 인정됩니다.
| 날짜 | 모델 | 점수 | 출처 |
|---|---|---|---|
| 2026-07-26 | Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 | 74.219% | CrowdTensor, 자원봉사자 교육 베타 및 Qwen2.5-7B GSM8K 캠페인 초안 RFC 출시 |
| 2026-07-13 | Gemma-4-12B | 86.0% | Flint는 정확도를 유지하면서 추론 추적을 압축하여 토큰 사용량을 줄입니다 |
| 2024-12-17 | Falcon3-10B-Base | 83.0% | Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시 |
| 2024-12-17 | Falcon3-7B-Base | 79.1% | Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시 |
| 2024-12-17 | Falcon3-10B-Instruct | 83.1% | Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시 |
| 2024-07-15 | Qwen2-72B | 89.5% | Qwen 팀, 72B 밀집 및 MoE 모델이 포함된 Qwen2 시리즈 출시 |
| 2024-07-15 | Qwen2-72B | 89.5% | Qwen2 기술 보고서: 최대 72B 규모의 밀집형 및 MoE 모델 소개 |
| 2024-06-20 | Claude 3.5 Sonnet | 91.6% | Anthropic, Claude 3.5 Sonnet의 향상된 코딩 및 비전 벤치마크를 포함한 추가 문서 출시 |
| 2024-04-23 | DUP method | 97.1% | 문제를 깊이 이해하는 방법이 GSM8K에서 97.1% 달성 |
| 2024-03-28 | Grok-1.5 | 90.0% | xAI, 추론 능력 향상 및 128K 컨텍스트를 갖춘 Grok-1.5 출시 |
| 2023-03-14 | GPT-4 | 92.0% | OpenAI |