Бенчмарк · general

MMLU

saturated 15 результатов 12 моделей

MMLU (Massive Multitask Language Understanding) проверяет широту знаний модели по 57 предметам — от истории и права до математики и медицины — с помощью вопросов с выбором ответа. Результат выражается в % точности: доле вопросов, на которые дан правильный ответ.

Подробнее
Пример
Типичное задание содержит вопрос и четыре помеченных варианта ответа (A–D), из которых модель должна выбрать правильный — например, вопрос по медицине уровня вуза или простая задача по математике.
Метрика
Метрика — точность (accuracy): процент вопросов с выбором ответа, для которых модель выбрала правильный вариант, усреднённый по всем 57 предметам.
Приёмка
Проверка автоматическая и объективная — выбранная моделью буква точно сверяется с известным правильным ответом, поэтому участие человека не требуется.
Почему важно
MMLU стал стандартным мерилом широты знаний и рассуждений, но лучшие модели набирают на нём столь высокие баллы, что он в значительной степени насыщен и хуже различает сильнейшие системы.
Разбор примера
Задача
Ниже приведён вопрос с выбором ответа по химии уровня старшей школы. Какое из перечисленных веществ является сильной кислотой? A) HF B) HCl C) CH3COOH D) H2CO3
Решение
HCl полностью ионизируется в воде, поэтому это сильная кислота; HF, CH3COOH и H2CO3 ионизируются лишь частично (слабые кислоты). Итоговый ответ: B) HCl.
Разбор
Сильная кислота в водном растворе полностью диссоциирует на H+ и сопряжённое основание, что делает HCl, а остальные — нет. MMLU оценивает ответ по точному совпадению: выбранная буква варианта должна совпасть с эталонной меткой (B).
0 24 48 72 96 2023-03-14 2024-03-29 2025-04-15 Gemini Ultra · 90 · 2023-12-06 Gemini Ultra · 90 · 2023-12-06 Qwen2-72B · 84.2 · 2024-07-15 Qwen2-72B · 84.2 · 2024-07-15 Mistral Large 2 · 84 · 2024-07-24 Mistral Large 2 · 84 · 2024-07-25 Falcon3-10B-Base · 73.1 · 2024-12-17 Falcon3-7B-Base · 67.4 · 2024-12-17 Claude 3.7 Sonnet · 86.1 · 2025-02-24 GPT‑4.1 nano · 80.1 · 2025-04-14 Gemini 2.0 Flash · 83.4 · 2025-04-15 GPT-3.5 · 70 · 2023-03-14 GPT-4 · 86.4 · 2023-03-14 Claude 2 · 78.5 · 2023-07-11 Claude 3 Opus · 86.8 · 2024-03-04
Gemini Ultra Qwen2-72B Mistral Large 2 Falcon3-10B-Base Falcon3-7B-Base Claude 3.7 Sonnet GPT‑4.1 nano Gemini 2.0 Flash GPT-3.5 GPT-4 Claude 2 Claude 3 Opus
Хронология
Дата Модель Результат Источник
2025-04-15 Gemini 2.0 Flash 83.4% Google выпустила Gemini 2.0 Flash с улучшенным качеством и двукратной скоростью по сравнению с Gemini 1.5 Pro
2025-04-14 GPT‑4.1 nano 80.1% OpenAI запустила GPT-4.1, GPT-4.1 mini и GPT-4.1 nano в API
2025-02-24 Claude 3.7 Sonnet 86.1% Anthropic выпустила Claude 3.7 Sonnet с динамическим управлением рассуждением
2024-12-17 Falcon3-10B-Base 73.1% Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании
2024-12-17 Falcon3-7B-Base 67.4% Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании
2024-07-25 Mistral Large 2 84.0% Mistral выпустила Mistral Large 2 с контекстом 128K и улучшенной поддержкой нескольких языков
2024-07-24 Mistral Large 2 84.0% Mistral выпускает Large 2 с 123B параметров для экономичного инференса на одном узле
2024-07-15 Qwen2-72B 84.2% Команда Qwen выпустила серию Qwen2 с моделями на 72B (плотными и MoE)
2024-07-15 Qwen2-72B 84.2% Технический отчет Qwen2 представляет плотные и MoE модели до 72B
2024-03-04 Claude 3 Opus 86.8% Anthropic
2023-12-06 Gemini Ultra 90.0% Google представляет Gemini 1.0, свою самую крупную мультимодальную ИИ-модель
2023-12-06 Gemini Ultra 90.0% Google
2023-07-11 Claude 2 78.5% Anthropic
2023-03-14 GPT-3.5 70.0% OpenAI
2023-03-14 GPT-4 86.4% OpenAI