벤치마크 · multimodal
MMMU
MMMU(Massive Multi-discipline Multimodal Understanding)는 여러 학문 분야에 걸쳐 이미지와 텍스트를 결합한 대학 수준의 문제에 모델이 답할 수 있는지를 평가합니다. 결과는 정답률(퍼센트)로 보고됩니다.
자세히 보기
- 예시
- 한 문제에서 화학 도표, 그래프, 의료 영상 등이 텍스트와 함께 제시되고, 모델은 이를 추론하여 정답을 골라야 합니다. 대학 시험에 나올 법한 문항입니다.
- 채점 방식
- 각 문제는 정답 또는 오답으로 채점되며, 점수는 맞힌 문제의 비율(정답률)입니다.
- 검증 방식
- 답은 기준 정답과의 정확 일치(exact match)로 자동 검증되며(대부분 객관식, 일부 짧은 주관식), 사람의 평가가 필요하지 않습니다.
- 왜 중요한가
- 수십 개 과목에 걸쳐 이미지와 텍스트에 대한 전문가·대학 수준의 추론을 측정하므로, 텍스트만 다루는 능력이 아니라 진정한 멀티모달 이해력을 엄격하게 검증합니다.
예제 풀이
문제
(이미지: 회로도 — 12 V 전지가 단일 루프를 이루고 두 저항 R1 = 4 Ω 과 R2 = 8 Ω 이 직렬로 연결되어 있다.) 저항 R2 에 흐르는 전류는 얼마인가? 선택지: (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A.
해답
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
풀이
직렬 회로에서는 모든 소자에 같은 전류가 흐르고 전체 저항은 각 부분의 합이므로 I = 12/12 = 1.0 A 이다. MMMU 는 예측한 선택지 문자와 유일한 정답의 정확한 일치로 채점한다.
| 날짜 | 모델 | 점수 | 출처 |
|---|---|---|---|
| 2025-08-07 | GPT-5 | 84.2% | OpenAI가 통합 라우팅과 전문가 수준의 추론을 갖춘 GPT-5를 출시하다 |
| 2025-08-07 | GPT-5 | 84.2% | OpenAI, 적응형 추론과 통합 아키텍처를 갖춘 GPT-5 출시 |
| 2025-04-17 | o4-mini | 81.6% | OpenAI가 더 빠르고 저렴한 다중 모달 추론 모델인 o4-mini 출시 |
| 2025-04-15 | Gemini 2.0 Flash | 71.7% | 구글, Gemini 1.5 Pro보다 두 배 빠른 속도와 향상된 품질의 Gemini 2.0 Flash 출시 |
| 2025-03-26 | Gemini 2.5 Pro | 81.7% | 구글, 100만 토큰 컨텍스트를 지원하는 실험용 Gemini 2.5 Pro 추론 모델 출시 |
| 2024-05-13 | GPT-4o | 69.1% | OpenAI |
| 2024-03-04 | Claude 3 Opus | 59.4% | Anthropic |
| 2023-11-27 | GPT-4V | 56.8% | MMMU paper |