Бенчмарк · multimodal

MMMU

8 результатов 7 моделей

MMMU (Massive Multi-discipline Multimodal Understanding) проверяет, способна ли модель отвечать на вопросы университетского уровня, которые объединяют изображения и текст из множества научных дисциплин. Результат выражается в проценте правильных ответов (точность).

Подробнее
Пример
В вопросе могут дать химическую схему, график или медицинское изображение вместе с текстом и попросить модель порассуждать и выбрать правильный ответ — как в экзаменационном задании вуза.
Метрика
Каждый вопрос оценивается как верный или неверный, а итоговый балл — это процент вопросов, на которые дан правильный ответ (точность).
Приёмка
Ответы проверяются автоматически точным совпадением с эталонным ответом (в основном варианты выбора, иногда короткие открытые ответы), поэтому участие человека не требуется.
Почему важно
Он измеряет экспертное мышление университетского уровня на стыке изображений и текста в десятках предметов, что делает его строгой проверкой настоящего мультимодального понимания, а не только работы с текстом.
Разбор примера
Задача
(Изображение: схема цепи — батарея 12 V в одном контуре с двумя последовательно соединёнными резисторами, R1 = 4 Ω и R2 = 8 Ω.) Какой ток течёт через резистор R2? Варианты: (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A.
Решение
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
Разбор
В последовательной цепи через все элементы течёт одинаковый ток, а общее сопротивление равно сумме сопротивлений, поэтому I = 12/12 = 1.0 A. MMMU оценивает ответ по точному совпадению выбранной буквы варианта с единственным эталонным ответом.
0 22.5 45 67.5 90 2023-11-27 2024-10-01 2025-08-07 Gemini 2.5 Pro · 81.7 · 2025-03-26 Gemini 2.0 Flash · 71.7 · 2025-04-15 o4-mini · 81.6 · 2025-04-17 GPT-5 · 84.2 · 2025-08-07 GPT-5 · 84.2 · 2025-08-07 GPT-4V · 56.8 · 2023-11-27 Claude 3 Opus · 59.4 · 2024-03-04 GPT-4o · 69.1 · 2024-05-13
Gemini 2.5 Pro Gemini 2.0 Flash o4-mini GPT-5 GPT-4V Claude 3 Opus GPT-4o
Хронология
Дата Модель Результат Источник
2025-08-07 GPT-5 84.2% OpenAI представляет GPT-5 с единым маршрутизатором и рассуждениями экспертного уровня
2025-08-07 GPT-5 84.2% OpenAI запускает GPT-5 с адаптивным рассуждением и единой архитектурой
2025-04-17 o4-mini 81.6% OpenAI выпустила o4-mini: более быструю и дешёвую мультимодальную модель рассуждений
2025-04-15 Gemini 2.0 Flash 71.7% Google выпустила Gemini 2.0 Flash с улучшенным качеством и двукратной скоростью по сравнению с Gemini 1.5 Pro
2025-03-26 Gemini 2.5 Pro 81.7% Google выпустила экспериментальную модель рассуждений Gemini 2.5 Pro с контекстом на 1 млн токенов
2024-05-13 GPT-4o 69.1% OpenAI
2024-03-04 Claude 3 Opus 59.4% Anthropic
2023-11-27 GPT-4V 56.8% MMMU paper