벤치마크 · multimodal

MMMU

8 결과 7 모델

MMMU(Massive Multi-discipline Multimodal Understanding)는 여러 학문 분야에 걸쳐 이미지와 텍스트를 결합한 대학 수준의 문제에 모델이 답할 수 있는지를 평가합니다. 결과는 정답률(퍼센트)로 보고됩니다.

자세히 보기
예시
한 문제에서 화학 도표, 그래프, 의료 영상 등이 텍스트와 함께 제시되고, 모델은 이를 추론하여 정답을 골라야 합니다. 대학 시험에 나올 법한 문항입니다.
채점 방식
각 문제는 정답 또는 오답으로 채점되며, 점수는 맞힌 문제의 비율(정답률)입니다.
검증 방식
답은 기준 정답과의 정확 일치(exact match)로 자동 검증되며(대부분 객관식, 일부 짧은 주관식), 사람의 평가가 필요하지 않습니다.
왜 중요한가
수십 개 과목에 걸쳐 이미지와 텍스트에 대한 전문가·대학 수준의 추론을 측정하므로, 텍스트만 다루는 능력이 아니라 진정한 멀티모달 이해력을 엄격하게 검증합니다.
예제 풀이
문제
(이미지: 회로도 — 12 V 전지가 단일 루프를 이루고 두 저항 R1 = 4 Ω 과 R2 = 8 Ω 이 직렬로 연결되어 있다.) 저항 R2 에 흐르는 전류는 얼마인가? 선택지: (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A.
해답
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
풀이
직렬 회로에서는 모든 소자에 같은 전류가 흐르고 전체 저항은 각 부분의 합이므로 I = 12/12 = 1.0 A 이다. MMMU 는 예측한 선택지 문자와 유일한 정답의 정확한 일치로 채점한다.
0 22.5 45 67.5 90 2023-11-27 2024-10-01 2025-08-07 Gemini 2.5 Pro · 81.7 · 2025-03-26 Gemini 2.0 Flash · 71.7 · 2025-04-15 o4-mini · 81.6 · 2025-04-17 GPT-5 · 84.2 · 2025-08-07 GPT-5 · 84.2 · 2025-08-07 GPT-4V · 56.8 · 2023-11-27 Claude 3 Opus · 59.4 · 2024-03-04 GPT-4o · 69.1 · 2024-05-13
Gemini 2.5 Pro Gemini 2.0 Flash o4-mini GPT-5 GPT-4V Claude 3 Opus GPT-4o
타임라인
날짜 모델 점수 출처
2025-08-07 GPT-5 84.2% OpenAI가 통합 라우팅과 전문가 수준의 추론을 갖춘 GPT-5를 출시하다
2025-08-07 GPT-5 84.2% OpenAI, 적응형 추론과 통합 아키텍처를 갖춘 GPT-5 출시
2025-04-17 o4-mini 81.6% OpenAI가 더 빠르고 저렴한 다중 모달 추론 모델인 o4-mini 출시
2025-04-15 Gemini 2.0 Flash 71.7% 구글, Gemini 1.5 Pro보다 두 배 빠른 속도와 향상된 품질의 Gemini 2.0 Flash 출시
2025-03-26 Gemini 2.5 Pro 81.7% 구글, 100만 토큰 컨텍스트를 지원하는 실험용 Gemini 2.5 Pro 추론 모델 출시
2024-05-13 GPT-4o 69.1% OpenAI
2024-03-04 Claude 3 Opus 59.4% Anthropic
2023-11-27 GPT-4V 56.8% MMMU paper