벤치마크 · general
MMLU
MMLU(Massive Multitask Language Understanding)는 역사와 법률에서 수학과 의학까지 57개 과목의 객관식 문제로 모델의 지식 폭을 평가하는 벤치마크입니다. 결과는 정확도(% accuracy), 즉 맞힌 문제의 비율로 표시됩니다.
자세히 보기
- 예시
- 전형적인 문항은 질문과 네 개의 라벨이 붙은 보기(A–D)로 이루어지며, 모델은 정답을 골라야 합니다—예를 들어 대학 수준의 의학 문제나 초등 수학 문제 등입니다.
- 채점 방식
- 지표는 정확도(accuracy)로, 모델이 정답 보기를 고른 객관식 문제의 비율을 57개 과목 전체에 대해 평균 내어 계산합니다.
- 검증 방식
- 채점은 자동적이고 객관적입니다—모델이 고른 글자를 이미 알려진 정답과 정확히 일치(exact-match)하는지 대조하므로 사람의 판단이 필요 없습니다.
- 왜 중요한가
- MMLU는 일반 지식과 추론 폭을 재는 표준 잣대가 되었지만, 이제 상위 모델들의 점수가 매우 높아 대체로 포화되었고 최상위 시스템을 구분하기가 어려워졌습니다.
예제 풀이
문제
다음은 고등학교 화학에 관한 객관식 문제입니다. 다음 중 강산은 무엇입니까? A) HF B) HCl C) CH3COOH D) H2CO3
해답
HCl은 물에서 완전히 이온화되므로 강산이며, HF, CH3COOH, H2CO3은 부분적으로만 이온화된다(약산). 최종 답: B) HCl.
풀이
강산은 수용액에서 H+와 짝염기로 완전히 해리되는데, HCl은 그러하지만 나머지는 그렇지 않다. MMLU는 정확 일치 정확도로 채점하며, 선택한 보기의 문자가 정답 레이블(B)과 같아야 한다.
| 날짜 | 모델 | 점수 | 출처 |
|---|---|---|---|
| 2025-04-15 | Gemini 2.0 Flash | 83.4% | 구글, Gemini 1.5 Pro보다 두 배 빠른 속도와 향상된 품질의 Gemini 2.0 Flash 출시 |
| 2025-04-14 | GPT‑4.1 nano | 80.1% | OpenAI, API에 GPT-4.1, GPT-4.1 mini, GPT-4.1 nano 출시 |
| 2025-02-24 | Claude 3.7 Sonnet | 86.1% | Anthropic, 동적 추론 제어가 가능한 Claude 3.7 Sonnet 출시 |
| 2024-12-17 | Falcon3-10B-Base | 73.1% | Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시 |
| 2024-12-17 | Falcon3-7B-Base | 67.4% | Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시 |
| 2024-07-25 | Mistral Large 2 | 84.0% | Mistral, 128K 컨텍스트 및 향상된 다국어 지원을 갖춘 Mistral Large 2 출시 |
| 2024-07-24 | Mistral Large 2 | 84.0% | Mistral이 비용 효율적인 단일 노드 추론을 위해 123B 파라미터의 Large 2를 출시 |
| 2024-07-15 | Qwen2-72B | 84.2% | Qwen 팀, 72B 밀집 및 MoE 모델이 포함된 Qwen2 시리즈 출시 |
| 2024-07-15 | Qwen2-72B | 84.2% | Qwen2 기술 보고서: 최대 72B 규모의 밀집형 및 MoE 모델 소개 |
| 2024-03-04 | Claude 3 Opus | 86.8% | Anthropic |
| 2023-12-06 | Gemini Ultra | 90.0% | Google, 최대 규모 멀티모달 AI 모델 'Gemini 1.0' 발표 |
| 2023-12-06 | Gemini Ultra | 90.0% | |
| 2023-07-11 | Claude 2 | 78.5% | Anthropic |
| 2023-03-14 | GPT-3.5 | 70.0% | OpenAI |
| 2023-03-14 | GPT-4 | 86.4% | OpenAI |