벤치마크 · general
MMLU-Pro
MMLU-Pro는 MMLU를 더 어렵고 추론 중심으로 개선한 후속 벤치마크로, 문항마다 10개의 선택지를 제공하는 객관식 문제를 통해 여러 학문 분야에 걸친 모델의 지식과 문제 해결 능력을 평가합니다. 결과는 정확도 백분율, 즉 정답을 맞힌 문항의 비율로 보고됩니다.
자세히 보기
- 예시
- 전형적인 문항은 수학, 물리, 법학, 공학 같은 분야의 객관식 문제로, 여러 단계의 추론이 필요하며 모델은 10개의 선택지 중 유일한 정답을 골라야 합니다(원래 MMLU는 4개 선택지였습니다).
- 채점 방식
- 지표는 정확도(accuracy)로, 모델이 올바른 선택지를 고른 문항의 비율이며 정답 수를 전체 문항 수로 나누어 계산합니다.
- 검증 방식
- 각 응답은 모델이 선택한 보기를 알려진 정답 레이블과 정확히 일치(exact match)시키는 방식으로 자동 채점되므로 사람의 판정이 필요 없습니다.
- 왜 중요한가
- 선도 모델들이 원래 MMLU를 거의 포화시켰기 때문에, MMLU-Pro의 더 어려운 문제와 10개 선택지는 변별력을 높이고 실제 추론에 더 민감하게 만들어 진전을 더 명확하게 보여 줍니다.
예제 풀이
문제
MMLU-Pro (물리, 10지선다). 발사체를 지면에서 20 m/s로 수평에서 30° 각도로 발사한다 (g = 10 m/s², 공기 저항 무시). 최대 높이는 얼마인가? A) 2.5 m B) 5.0 m C) 7.5 m D) 10.0 m E) 12.5 m F) 15.0 m G) 17.3 m H) 20.0 m I) 3.5 m J) 8.7 m
해답
v_y = v·sin30° = 20 × 0.5 = 10 m/s; h_max = v_y² / (2g) = 10² / (2 × 10) = 5.0 m → B
풀이
최고점에서 연직 속도가 0이므로 h_max = v_y²/(2g) (v_y = v·sin30°)이며, 높이는 연직 성분만으로 결정된다. MMLU-Pro는 선택한 글자를 정답 키와 정확히 일치시켜 채점한다 (10지선다에 대한 accuracy).
| 날짜 | 모델 | 점수 | 출처 |
|---|---|---|---|
| 2025-07-28 | GLM-4.5 | 84.6% | Zhipu AI, 지능형 에이전트를 위한 GLM-4.5 및 GLM-4.5-Air 파운데이션 모델 출시 |
| 2025-05-30 | Deepseek-R1-0528 | 85.0% | DeepSeek, 향상된 추론 및 벤치마크 점수로 R1 모델 업데이트 |
| 2025-04-15 | Gemini 2.0 Flash | 77.6% | 구글, Gemini 1.5 Pro보다 두 배 빠른 속도와 향상된 품질의 Gemini 2.0 Flash 출시 |
| 2025-03-24 | DeepSeek-V3-0324 | 81.2% | DeepSeek-V3-0324은 DeepSeek-V3 대비 추론, 코딩, 중국어 작문 능력을 향상 |
| 2024-12-17 | Falcon3-3B-Instruct | 29.7% | Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시 |
| 2024-12-17 | Falcon3-7B-Base | 39.2% | Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시 |
| 2024-12-17 | Falcon3-10B-Base | 42.5% | Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시 |
| 2024-06-20 | Claude 3.5 Sonnet | 90.4% | Anthropic, Claude 3.5 Sonnet의 향상된 코딩 및 비전 벤치마크를 포함한 추가 문서 출시 |
| 2024-06-03 | GPT-4o | 72.6% | MMLU-Pro는 10개의 옵션과 추론 중심 질문을 갖춘 더 강력한 벤치마크를 도입합니다 |
| 2024-06-03 | GPT-4-Turbo | 63.7% | MMLU-Pro는 10개의 옵션과 추론 중심 질문을 갖춘 더 강력한 벤치마크를 도입합니다 |
| 2024-06-03 | GPT-4o | 72.6% | MMLU-Pro paper |