벤치마크 · multimodal

MMMU-Pro

11 결과 8 모델

MMMU-Pro는 MMMU 벤치마크의 견고성을 강화한 버전으로, 여섯 개 학문 분야에 걸친 대학 수준의 멀티모달(이미지 + 텍스트) 이해·추론 능력을 측정합니다. 지표는 객관식 문제의 정확도(accuracy)입니다.

자세히 보기
예시
한 분야의 문제는 이미지 — 도해, 차트, 화학 구조식, 의료 영상 등 — 를 대학 수준의 질문 및 최대 10개의 보기와 짝지웁니다. 시각 전용(vision-only) 설정에서는 질문과 보기 전체가 스크린샷이나 사진 안에 삽입되므로, 모델은 이미지 자체에서 텍스트를 읽어내야 합니다.
채점 방식
정확도(accuracy): 모델이 고른 보기를 정답 키와 정확히 일치 비교하며, 점수는 맞힌 문제의 비율입니다. 무작위 추측을 어렵게 하려고 후보 보기를 4개에서 10개로 늘리며, MMMU-Pro 종합 점수는 Standard(10개 보기) 설정과 Vision(이미지 입력) 설정의 평균입니다(보통 Chain-of-Thought 추론 프롬프트를 사용합니다).
검증 방식
모든 문제는 정답이 하나인 객관식이므로 채점은 자동입니다. 모델의 출력(대개 사고 연쇄 포함)에서 최종 선택한 보기를 추출해 참조 정답과 정확히 일치하는지 비교합니다. 견고성은 데이터 자체에 내장되어 있습니다 — 텍스트만으로 답할 수 있는 문제는 걸러내고 보기 수를 10개로 늘렸습니다 — 따라서 높은 점수는 텍스트 지름길이나 요행 추측이 아니라 진정한 멀티모달 추론을 반영합니다.
왜 중요한가
원래 MMMU는 모델이 텍스트 전용 지름길을 이용하거나 네 개 보기 중에서 추측할 수 있었기 때문에 점수가 부풀려졌습니다. MMMU-Pro는 이 둘을 모두 제거하므로 측정된 정확도가 크게 떨어지고, 시각과 텍스트를 실제로 통합하는 모델을 더 잘 구분합니다 — 전문가 수준의 멀티모달 능력을 더 정직하게 재는 척도가 됩니다.
예제 풀이
문제
MMMU-Pro 형식의 대표적인 과학(물리) 문항. [이미지: 경사각 θ = 30°인 마찰 없는 빗면 위에 놓인 물체.] 질문: 빗면을 따라 나타나는 물체의 가속도 크기는 얼마인가? 보기(10): (A) 0 m/s² (B) 1.6 m/s² (C) 2.5 m/s² (D) 3.3 m/s² (E) 4.9 m/s² (F) 5.7 m/s² (G) 6.9 m/s² (H) 7.4 m/s² (I) 8.5 m/s² (J) 9.8 m/s². 시각 전용 설정에서는 이 문항 전체가 스크린샷 안에 삽입되어 표시됩니다.
해답
a = g·sin θ = 9.8 × sin 30° = 9.8 × 0.5 = 4.9 m/s² → (E)
풀이
마찰 없는 빗면에서는 면을 따라 작용하는 힘이 중력 성분 mg·sin θ뿐이므로, 가속도는 g·sin θ이고 물체의 질량과 무관합니다. g·sin 30° = 4.9 m/s²이며, 이는 보기 (E)와 일치합니다. 채점은 추출한 보기 기호를 정답 키와 정확히 일치 비교합니다.
0 22.5 45 67.5 90 2023-12-06 2025-04-04 2026-08-03 Gemini Ultra · 59.4 · 2023-12-06 Claude 3.5 Sonnet · 68.3 · 2024-06-20 o1 · 78.2 · 2024-09-12 Gemini 2.5 Pro Deep Think · 84 · 2025-05-20 Gemini 3 Pro · 81 · 2025-11-18 Gemini 3 Pro · 81 · 2025-11-18 Claude Opus 4.6 · 73.9 · 2026-02-05 Claude Opus 4.6 · 70.6 · 2026-02-05 Claude Opus 4.6 · 70.6 · 2026-03-06 Kimi K3 · 81.6 · 2026-07-17 Inkling-Small · 74 · 2026-08-03
Gemini Ultra Claude 3.5 Sonnet o1 Gemini 2.5 Pro Deep Think Gemini 3 Pro Claude Opus 4.6 Kimi K3 Inkling-Small
타임라인
날짜 모델 점수 출처
2026-08-03 Inkling-Small 74.0% Thinking Machines Lab이 276B 오픈 가중치 멀티모달 MoE 모델인 Inkling-Small을 출시
2026-07-17 Kimi K3 81.6% 문샷 AI가 100만 토큰 컨텍스트를 지원하는 2.8T 파라미터 MoE 모델인 오픈 Kimi K3 출시
2026-03-06 Claude Opus 4.6 70.6% Anthropic, Claude Opus 4.6 시스템 카드 공개 및 기능과 안전성 평가 상세 내용 발표
2026-02-05 Claude Opus 4.6 73.9% Anthropic, 1M 컨텍스트 창과 에이전트 기능 개선을 갖춘 Claude Opus 4.6 출시
2026-02-05 Claude Opus 4.6 70.6% Anthropic, Claude Opus 4.6 시스템 카드 발표: 기능 및 안전성 평가 상세 내용
2025-11-18 Gemini 3 Pro 81.0% 구글, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
2025-11-18 Gemini 3 Pro 81.0% Google, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
2025-05-20 Gemini 2.5 Pro Deep Think 84.0% 구글 딥마인드, Deep Think, 오디오 출력, 컴퓨터 사용 기능으로 Gemini 2.5 업데이트
2024-09-12 o1 78.2% OpenAI가 수학 및 과학 벤치마크에서 인간 전문가를 능가하는 추론 모델 o1-preview 출시
2024-06-20 Claude 3.5 Sonnet 68.3% Anthropic, Claude 3.5 Sonnet의 향상된 코딩 및 비전 벤치마크를 포함한 추가 문서 출시
2023-12-06 Gemini Ultra 59.4% Google, 최대 규모 멀티모달 AI 모델 'Gemini 1.0' 발표