Бенчмарк · general

MMLU-Pro

11 результатов 10 моделей

MMLU-Pro — более сложный, ориентированный на рассуждения преемник MMLU, который проверяет знания модели и умение решать задачи по многим академическим дисциплинам с помощью вопросов с выбором ответа, где к каждому предлагается 10 вариантов. Результат измеряется в процентах точности — это доля вопросов, на которые дан верный ответ.

Подробнее
Пример
Типичное задание — вопрос с выбором ответа из такой области, как математика, физика, право или инженерия, требующий нескольких шагов рассуждения, где модель должна выбрать единственный правильный ответ из 10 вариантов (против 4 в исходном MMLU).
Метрика
Метрика — точность (accuracy): процент вопросов, в которых модель выбрала правильный вариант, вычисляется как число верных ответов, делённое на общее число вопросов.
Приёмка
Каждый ответ проверяется автоматически — выбранный моделью вариант точно сопоставляется с известной правильной меткой (exact match), поэтому участие человека не требуется.
Почему важно
Поскольку ведущие модели почти исчерпали исходный MMLU, более трудные вопросы и 10 вариантов в MMLU-Pro делают тест более различающим и более чувствительным к настоящему рассуждению, давая более чистый сигнал прогресса.
Разбор примера
Задача
MMLU-Pro (физика, 10 вариантов). Снаряд запущен с уровня земли со скоростью 20 m/s под углом 30° к горизонту (g = 10 m/s², без сопротивления воздуха). Какова его максимальная высота? A) 2.5 m B) 5.0 m C) 7.5 m D) 10.0 m E) 12.5 m F) 15.0 m G) 17.3 m H) 20.0 m I) 3.5 m J) 8.7 m
Решение
v_y = v·sin30° = 20 × 0.5 = 10 m/s; h_max = v_y² / (2g) = 10² / (2 × 10) = 5.0 m → B
Разбор
В верхней точке вертикальная скорость равна нулю, поэтому h_max = v_y²/(2g), где v_y = v·sin30°; высоту задаёт только вертикальная составляющая. MMLU-Pro оценивает по точному совпадению выбранной буквы с эталонным ключом (accuracy по 10 вариантам).
0 24 48 72 96 2024-06-03 2024-12-30 2025-07-28 GPT-4o · 72.6 · 2024-06-03 GPT-4o · 72.6 · 2024-06-03 GPT-4-Turbo · 63.7 · 2024-06-03 Claude 3.5 Sonnet · 90.4 · 2024-06-20 Falcon3-3B-Instruct · 29.7 · 2024-12-17 Falcon3-7B-Base · 39.2 · 2024-12-17 Falcon3-10B-Base · 42.5 · 2024-12-17 DeepSeek-V3-0324 · 81.2 · 2025-03-24 Gemini 2.0 Flash · 77.6 · 2025-04-15 Deepseek-R1-0528 · 85 · 2025-05-30 GLM-4.5 · 84.6 · 2025-07-28
GPT-4o GPT-4-Turbo Claude 3.5 Sonnet Falcon3-3B-Instruct Falcon3-7B-Base Falcon3-10B-Base DeepSeek-V3-0324 Gemini 2.0 Flash Deepseek-R1-0528 GLM-4.5
Хронология
Дата Модель Результат Источник
2025-07-28 GLM-4.5 84.6% Zhipu AI выпустила базовые модели GLM-4.5 и GLM-4.5-Air для интеллектуальных агентов
2025-05-30 Deepseek-R1-0528 85.0% DeepSeek обновляет модель R1 с улучшенными способностями к рассуждению и результатами на бенчмарках
2025-04-15 Gemini 2.0 Flash 77.6% Google выпустила Gemini 2.0 Flash с улучшенным качеством и двукратной скоростью по сравнению с Gemini 1.5 Pro
2025-03-24 DeepSeek-V3-0324 81.2% DeepSeek-V3-0324 улучшает рассуждения, программирование и китайское письмо по сравнению с DeepSeek-V3
2024-12-17 Falcon3-3B-Instruct 29.7% Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании
2024-12-17 Falcon3-7B-Base 39.2% Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании
2024-12-17 Falcon3-10B-Base 42.5% Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании
2024-06-20 Claude 3.5 Sonnet 90.4% Anthropic выпустила дополнение к Claude 3.5 Sonnet с улучшенными показателями в задачах программирования и зрения
2024-06-03 GPT-4o 72.6% MMLU-Pro представляет более надежный бенчмарк с 10 вариантами ответов и вопросами, ориентированными на рассуждения
2024-06-03 GPT-4-Turbo 63.7% MMLU-Pro представляет более надежный бенчмарк с 10 вариантами ответов и вопросами, ориентированными на рассуждения
2024-06-03 GPT-4o 72.6% MMLU-Pro paper