Бенчмарк · math

MATH-500

saturated 18 результатов 17 моделей

MATH-500 — это подмножество из 500 задач датасета соревновательной математики MATH, которое проверяет способность модели решать сложные математические задачи. Оценка — это процент задач, в которых модель дала верный итоговый ответ.

Подробнее
Пример
Типичное задание — математическая задача олимпиадного уровня: например, вопрос по алгебре, геометрии или теории чисел, требующий единственного итогового ответа (числа или выражения в замкнутой форме) после нескольких шагов рассуждений.
Метрика
Оценка — это доля из 500 задач, решённых верно, то есть accuracy = число верных итоговых ответов / 500, выраженная в процентах.
Приёмка
Задача считается решённой, когда итоговый ответ модели точно совпадает с эталонным ответом (автоматическая проверка эквивалентности итогового ответа, а не промежуточных шагов).
Почему важно
Это компактный и широко используемый показатель математического мышления, который прогоняется быстрее полного набора MATH, поэтому его часто применяют для быстрой проверки при сравнении моделей рассуждения.
Разбор примера
Задача
При некоторых значениях $k$ квадратное уравнение $x^2 - kx + 16 = 0$ имеет только целые положительные корни. Найдите сумму всех различных возможных значений $k$.
Решение
Roots $r,s$: $rs=16$, $k=r+s$. Pairs $(1,16),(2,8),(4,4)\Rightarrow k\in\{17,10,8\}$. Distinct sum $=17+10+8=\boxed{35}$.
Разбор
Корни $r,s$ — целые положительные числа с $rs=16$ и $k=r+s$; пары множителей $(1,16),(2,8),(4,4)$ дают $k=17,10,8$, поэтому сумма различных значений равна $35$. MATH-500 оценивает по точному совпадению нормализованного финального ответа в \boxed{}, так что засчитывается только $35$.
0 25 50 75 100 2024-02-05 2025-04-21 2026-07-07 DeepSeekMath 7B · 51.7 · 2024-02-05 Grok-1.5 · 50.6 · 2024-03-28 Claude 3.5 Sonnet · 71.1 · 2024-06-20 Claude 3.5 Sonnet · 82.2 · 2025-02-26 QwQ-32B-Preview · 90.6 · 2024-11-28 Kimi k1.5 · 96.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 94.6 · 2025-01-22 DeepSeek-R1 · 97.3 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 94.3 · 2025-01-22 LIMO · 94.8 · 2025-02-05 Claude 3.7 Sonnet · 96.2 · 2025-02-26 Gemini 2.0 Flash · 90.9 · 2025-04-15 Phi-4-Mini-Reasoning · 3.2 · 2025-04-30 Llama-8B · 89.1 · 2025-04-30 Qwen-1.5B · 83.9 · 2025-04-30 GLM-4.5 · 98.2 · 2025-08-06 Qwen3.6-27B · 87 · 2026-07-07 Qwen3.6-27B-DFlash · 86 · 2026-07-07
DeepSeekMath 7B Grok-1.5 Claude 3.5 Sonnet QwQ-32B-Preview Kimi k1.5 Kimi k1.5 (short-CoT) DeepSeek-R1 DeepSeek-R1-Distill-Qwen-32B LIMO Claude 3.7 Sonnet Gemini 2.0 Flash Phi-4-Mini-Reasoning Llama-8B Qwen-1.5B GLM-4.5 Qwen3.6-27B Qwen3.6-27B-DFlash
Хронология
Дата Модель Результат Источник
2026-07-07 Qwen3.6-27B 87.0% Слияние DFlash в llama.cpp обеспечивает ускорение в 4.44 раза на Qwen 3.6 27B
2026-07-07 Qwen3.6-27B-DFlash 86.0% Слияние DFlash в llama.cpp обеспечивает ускорение в 4.44 раза на Qwen 3.6 27B
2025-08-06 GLM-4.5 98.2% Zhipu AI выпустила модели GLM-4.5, сопоставимые с Claude и DeepSeek
2025-04-30 Phi-4-Mini-Reasoning 3.2% Microsoft выпустила Phi-4-Mini-Reasoning, модель на 3.8B параметров, превосходящую более крупные модели для рассуждений
2025-04-30 Llama-8B 89.1% Microsoft выпустила Phi-4-Mini-Reasoning, модель на 3.8B параметров, превосходящую более крупные модели для рассуждений
2025-04-30 Qwen-1.5B 83.9% Microsoft выпустила Phi-4-Mini-Reasoning, модель на 3.8B параметров, превосходящую более крупные модели для рассуждений
2025-04-15 Gemini 2.0 Flash 90.9% Google выпустила Gemini 2.0 Flash с улучшенным качеством и двукратной скоростью по сравнению с Gemini 1.5 Pro
2025-02-26 Claude 3.7 Sonnet 96.2% Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 82.2% Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
2025-02-05 LIMO 94.8% GAIR-NLP выпускает LIMO, демонстрируя сильные способности к математическому рассуждению на 817 примерах
2025-01-22 Kimi k1.5 96.2% Kimi k1.5 масштабирует обучение с подкреплением на основе LLM для достижения уровня o1 и превосходства над моделями с коротким цепочечным мышлением
2025-01-22 Kimi k1.5 (short-CoT) 94.6% Kimi k1.5 масштабирует обучение с подкреплением на основе LLM для достижения уровня o1 и превосходства над моделями с коротким цепочечным мышлением
2025-01-22 DeepSeek-R1 97.3% DeepSeek выпускает модели рассуждений R1 с помощью обучения с подкреплением
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 94.3% DeepSeek выпускает модели рассуждений R1 с помощью обучения с подкреплением
2024-11-28 QwQ-32B-Preview 90.6% Qwen выпустила QwQ-32B-Preview, экспериментальную модель рассуждений
2024-06-20 Claude 3.5 Sonnet 71.1% Anthropic выпустила дополнение к Claude 3.5 Sonnet с улучшенными показателями в задачах программирования и зрения
2024-03-28 Grok-1.5 50.6% xAI выпустила Grok-1.5 с улучшенным рассуждением и контекстом 128K
2024-02-05 DeepSeekMath 7B 51.7% DeepSeekMath 7B достигает 51,7% на бенчмарке MATH с использованием GRPO и курируемых данных