Бенчмарк · multimodal
MMMU
MMMU (Massive Multi-discipline Multimodal Understanding) проверяет, способна ли модель отвечать на вопросы университетского уровня, которые объединяют изображения и текст из множества научных дисциплин. Результат выражается в проценте правильных ответов (точность).
Подробнее
- Пример
- В вопросе могут дать химическую схему, график или медицинское изображение вместе с текстом и попросить модель порассуждать и выбрать правильный ответ — как в экзаменационном задании вуза.
- Метрика
- Каждый вопрос оценивается как верный или неверный, а итоговый балл — это процент вопросов, на которые дан правильный ответ (точность).
- Приёмка
- Ответы проверяются автоматически точным совпадением с эталонным ответом (в основном варианты выбора, иногда короткие открытые ответы), поэтому участие человека не требуется.
- Почему важно
- Он измеряет экспертное мышление университетского уровня на стыке изображений и текста в десятках предметов, что делает его строгой проверкой настоящего мультимодального понимания, а не только работы с текстом.
Разбор примера
Задача
(Изображение: схема цепи — батарея 12 V в одном контуре с двумя последовательно соединёнными резисторами, R1 = 4 Ω и R2 = 8 Ω.) Какой ток течёт через резистор R2? Варианты: (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A.
Решение
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
Разбор
В последовательной цепи через все элементы течёт одинаковый ток, а общее сопротивление равно сумме сопротивлений, поэтому I = 12/12 = 1.0 A. MMMU оценивает ответ по точному совпадению выбранной буквы варианта с единственным эталонным ответом.
| Дата | Модель | Результат | Источник |
|---|---|---|---|
| 2025-08-07 | GPT-5 | 84.2% | OpenAI представляет GPT-5 с единым маршрутизатором и рассуждениями экспертного уровня |
| 2025-08-07 | GPT-5 | 84.2% | OpenAI запускает GPT-5 с адаптивным рассуждением и единой архитектурой |
| 2025-04-17 | o4-mini | 81.6% | OpenAI выпустила o4-mini: более быструю и дешёвую мультимодальную модель рассуждений |
| 2025-04-15 | Gemini 2.0 Flash | 71.7% | Google выпустила Gemini 2.0 Flash с улучшенным качеством и двукратной скоростью по сравнению с Gemini 1.5 Pro |
| 2025-03-26 | Gemini 2.5 Pro | 81.7% | Google выпустила экспериментальную модель рассуждений Gemini 2.5 Pro с контекстом на 1 млн токенов |
| 2024-05-13 | GPT-4o | 69.1% | OpenAI |
| 2024-03-04 | Claude 3 Opus | 59.4% | Anthropic |
| 2023-11-27 | GPT-4V | 56.8% | MMMU paper |