Бенчмарк · math

GSM8K

saturated 13 результатов 11 моделей

GSM8K (Grade School Math 8K) — это набор школьных математических задач-историй, для решения каждой из которых нужно несколько шагов арифметических рассуждений; модель оценивается по доле задач, где её итоговый числовой ответ верен.

Подробнее
Пример
Короткая текстовая задача вроде «Наталья продала заколки 48 подругам в апреле и вдвое меньше в мае; сколько заколок она продала всего?» — модель должна пройти все шаги и назвать итоговое число.
Метрика
Оценка — это accuracy (точность): доля задач, у которых итоговый числовой ответ в точности совпадает с эталонным; промежуточные рассуждения не оцениваются, только финальное число.
Приёмка
Проверка автоматическая и по точному совпадению: итоговое число модели извлекается (обычно после разделителя вроде «####») и сравнивается с эталонным ответом, так что участие человека не нужно.
Почему важно
Он стал стандартным и легко проверяемым тестом многошаговых рассуждений, а известный приём подсказок chain-of-thought заметно улучшал результаты на нём, сделав его частым мерилом способности рассуждать.
Разбор примера
Задача
У Марии 3 коробки карандашей, по 24 карандаша в каждой. Она отдаёт 15 карандашей брату, а затем покупает ещё 2 полные коробки. Сколько карандашей у неё теперь?
Решение
3 × 24 = 72; 72 − 15 = 57; 2 × 24 = 48; 57 + 48 = 105 → 105
Разбор
Умножаем, чтобы получить исходное количество, вычитаем отданное и прибавляем купленные коробки: 72 − 15 + 48 = 105. GSM8K оценивает только итоговое число, извлечённое после разделителя '####', по точному совпадению, поэтому шаги рассуждения не оцениваются — засчитывается лишь 105.
0 25 50 75 100 2023-03-14 2024-11-18 2026-07-26 Grok-1.5 · 90 · 2024-03-28 DUP method · 97.1 · 2024-04-23 Claude 3.5 Sonnet · 91.6 · 2024-06-20 Qwen2-72B · 89.5 · 2024-07-15 Qwen2-72B · 89.5 · 2024-07-15 Falcon3-10B-Instruct · 83.1 · 2024-12-17 Falcon3-10B-Base · 83 · 2024-12-17 Falcon3-7B-Base · 79.1 · 2024-12-17 LLaDA-8B · 76 · 2026-06-25 LLaDA-8B · 76 · 2026-06-29 Gemma-4-12B · 86 · 2026-07-13 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 · 74.2 · 2026-07-26 GPT-4 · 92 · 2023-03-14
Grok-1.5 DUP method Claude 3.5 Sonnet Qwen2-72B Falcon3-10B-Instruct Falcon3-10B-Base Falcon3-7B-Base LLaDA-8B Gemma-4-12B Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 GPT-4
Хронология
Дата Модель Результат Источник
2026-07-26 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 74.219% CrowdTensor запускает бета-версию волонтёрского обучения и черновик RFC кампании Qwen2.5-7B GSM8K
2026-07-13 Gemma-4-12B 86.0% Flint сжимает цепочки рассуждений для снижения расхода токенов при сохранении точности
2026-06-29 LLaDA-8B 76.0% Мысли о планировании: обучение порядку рассуждений в диффузионных языковых моделях
2026-06-25 LLaDA-8B 76.0% Самоосознающее планирование обучает порядку размаскирования токенов в диффузионных языковых моделях
2024-12-17 Falcon3-10B-Instruct 83.1% Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании
2024-12-17 Falcon3-10B-Base 83.0% Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании
2024-12-17 Falcon3-7B-Base 79.1% Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании
2024-07-15 Qwen2-72B 89.5% Команда Qwen выпустила серию Qwen2 с моделями на 72B (плотными и MoE)
2024-07-15 Qwen2-72B 89.5% Технический отчет Qwen2 представляет плотные и MoE модели до 72B
2024-06-20 Claude 3.5 Sonnet 91.6% Anthropic выпустила дополнение к Claude 3.5 Sonnet с улучшенными показателями в задачах программирования и зрения
2024-04-23 DUP method 97.1% Глубокое понимание проблем: метод достигает 97,1% на GSM8K
2024-03-28 Grok-1.5 90.0% xAI выпустила Grok-1.5 с улучшенным рассуждением и контекстом 128K
2023-03-14 GPT-4 92.0% OpenAI