벤치마크 · general

MMLU-Pro

11 결과 10 모델

MMLU-Pro는 MMLU를 더 어렵고 추론 중심으로 개선한 후속 벤치마크로, 문항마다 10개의 선택지를 제공하는 객관식 문제를 통해 여러 학문 분야에 걸친 모델의 지식과 문제 해결 능력을 평가합니다. 결과는 정확도 백분율, 즉 정답을 맞힌 문항의 비율로 보고됩니다.

자세히 보기
예시
전형적인 문항은 수학, 물리, 법학, 공학 같은 분야의 객관식 문제로, 여러 단계의 추론이 필요하며 모델은 10개의 선택지 중 유일한 정답을 골라야 합니다(원래 MMLU는 4개 선택지였습니다).
채점 방식
지표는 정확도(accuracy)로, 모델이 올바른 선택지를 고른 문항의 비율이며 정답 수를 전체 문항 수로 나누어 계산합니다.
검증 방식
각 응답은 모델이 선택한 보기를 알려진 정답 레이블과 정확히 일치(exact match)시키는 방식으로 자동 채점되므로 사람의 판정이 필요 없습니다.
왜 중요한가
선도 모델들이 원래 MMLU를 거의 포화시켰기 때문에, MMLU-Pro의 더 어려운 문제와 10개 선택지는 변별력을 높이고 실제 추론에 더 민감하게 만들어 진전을 더 명확하게 보여 줍니다.
예제 풀이
문제
MMLU-Pro (물리, 10지선다). 발사체를 지면에서 20 m/s로 수평에서 30° 각도로 발사한다 (g = 10 m/s², 공기 저항 무시). 최대 높이는 얼마인가? A) 2.5 m B) 5.0 m C) 7.5 m D) 10.0 m E) 12.5 m F) 15.0 m G) 17.3 m H) 20.0 m I) 3.5 m J) 8.7 m
해답
v_y = v·sin30° = 20 × 0.5 = 10 m/s; h_max = v_y² / (2g) = 10² / (2 × 10) = 5.0 m → B
풀이
최고점에서 연직 속도가 0이므로 h_max = v_y²/(2g) (v_y = v·sin30°)이며, 높이는 연직 성분만으로 결정된다. MMLU-Pro는 선택한 글자를 정답 키와 정확히 일치시켜 채점한다 (10지선다에 대한 accuracy).
0 24 48 72 96 2024-06-03 2024-12-30 2025-07-28 GPT-4o · 72.6 · 2024-06-03 GPT-4o · 72.6 · 2024-06-03 GPT-4-Turbo · 63.7 · 2024-06-03 Claude 3.5 Sonnet · 90.4 · 2024-06-20 Falcon3-3B-Instruct · 29.7 · 2024-12-17 Falcon3-7B-Base · 39.2 · 2024-12-17 Falcon3-10B-Base · 42.5 · 2024-12-17 DeepSeek-V3-0324 · 81.2 · 2025-03-24 Gemini 2.0 Flash · 77.6 · 2025-04-15 Deepseek-R1-0528 · 85 · 2025-05-30 GLM-4.5 · 84.6 · 2025-07-28
GPT-4o GPT-4-Turbo Claude 3.5 Sonnet Falcon3-3B-Instruct Falcon3-7B-Base Falcon3-10B-Base DeepSeek-V3-0324 Gemini 2.0 Flash Deepseek-R1-0528 GLM-4.5
타임라인
날짜 모델 점수 출처
2025-07-28 GLM-4.5 84.6% Zhipu AI, 지능형 에이전트를 위한 GLM-4.5 및 GLM-4.5-Air 파운데이션 모델 출시
2025-05-30 Deepseek-R1-0528 85.0% DeepSeek, 향상된 추론 및 벤치마크 점수로 R1 모델 업데이트
2025-04-15 Gemini 2.0 Flash 77.6% 구글, Gemini 1.5 Pro보다 두 배 빠른 속도와 향상된 품질의 Gemini 2.0 Flash 출시
2025-03-24 DeepSeek-V3-0324 81.2% DeepSeek-V3-0324은 DeepSeek-V3 대비 추론, 코딩, 중국어 작문 능력을 향상
2024-12-17 Falcon3-3B-Instruct 29.7% Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시
2024-12-17 Falcon3-7B-Base 39.2% Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시
2024-12-17 Falcon3-10B-Base 42.5% Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시
2024-06-20 Claude 3.5 Sonnet 90.4% Anthropic, Claude 3.5 Sonnet의 향상된 코딩 및 비전 벤치마크를 포함한 추가 문서 출시
2024-06-03 GPT-4o 72.6% MMLU-Pro는 10개의 옵션과 추론 중심 질문을 갖춘 더 강력한 벤치마크를 도입합니다
2024-06-03 GPT-4-Turbo 63.7% MMLU-Pro는 10개의 옵션과 추론 중심 질문을 갖춘 더 강력한 벤치마크를 도입합니다
2024-06-03 GPT-4o 72.6% MMLU-Pro paper