Бенчмарк · math

AIME 2024

30 результатов 27 моделей

AIME 2024 оценивает продвинутое математическое мышление модели на 15 задачах American Invitational Mathematics Examination 2024 года и показывает процент правильно решённых.

Подробнее
Пример
Типичное задание — сложная задача школьной олимпиады, например по теории чисел или комбинаторике, ответом на которую служит одно целое число (в AIME ответ всегда целый, обычно от 0 до 999).
Метрика
Метрика — точность: доля из 15 задач, решённых верно, поэтому каждая решённая задача даёт 1/15 итогового результата.
Приёмка
Результат принимается по точному совпадению: итоговое целое число модели должно совпасть с официальным ответом; проверка автоматическая, без частичных баллов и без участия человека.
Почему важно
Это компактный набор сложных и свежих олимпиадных задач, требующих многошагового рассуждения, поэтому его широко используют для сравнения передовых моделей, а новизна задач снижает риск утечки в обучающие данные.
Разбор примера
Задача
Сколько положительных целых чисел n ≤ 600 делятся на 4 или на 6, но не делятся на 5? (Ответы AIME — целые числа от 0 до 999.)
Решение
Multiples of 4 or 6 that are ≤ 600: 150 + 100 − 50 = 200. Of these, the ones also divisible by 5 (multiples of 20 or 30, minus 60): 30 + 20 − 10 = 40. Answer: 200 − 40 = 160.
Разбор
По формуле включений-исключений на 4 или 6 делятся 200 чисел, из них 40 делятся ещё и на 5, остаётся 160. AIME автоматически проверяет только итоговое целое число (0–999), без частичных баллов за решение.
0 25 50 75 100 2024-09-12 2025-08-09 2026-07-07 o1 · 13.9 · 2024-09-12 OpenAI o1-preview · 83 · 2024-10-01 QwQ-32B-Preview · 50 · 2024-11-28 o3 · 96.7 · 2024-12-20 o3 · 96.7 · 2026-03-25 DeepSeek-R1-Distill-Qwen-7B · 55.5 · 2025-01-22 DeepSeek-R1-Zero · 71 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 72.6 · 2025-01-22 DeepSeek-R1 · 79.8 · 2025-01-22 s1-32B · 57 · 2025-01-31 s1-32B · 57 · 2025-01-31 LIMO · 57.1 · 2025-02-05 Grok 3 mini · 95.8 · 2025-02-19 Claude 3.7 Sonnet · 80 · 2025-02-24 GPT-4.5 · 36.7 · 2025-03-05 DeepSeek-V3-0324 · 59.4 · 2025-03-24 Gemini 2.5 Pro · 92 · 2025-03-26 Seed1.5-Thinking · 86.7 · 2025-04-10 o4-mini · 93.4 · 2025-04-17 Qwen3-235B-A22B · 85.7 · 2025-05-14 Deepseek-R1-0528-Qwen3-8B · 86 · 2025-05-30 Deepseek-R1-0528 · 91.4 · 2025-05-30 Magistral Small · 70.7 · 2025-06-10 Magistral Medium · 73.6 · 2025-06-10 Magistral Medium · 50 · 2025-06-12 GLM-4.5 · 91 · 2025-08-06 GLM-4.5-Air · 89.4 · 2025-08-06 Qwen3-1.7B · 62.4 · 2026-07-07 DeepSeek R1 · 79.8 · 2025-01-20 OpenAI o3 · 91.6 · 2025-04-16
o1 OpenAI o1-preview QwQ-32B-Preview o3 DeepSeek-R1-Distill-Qwen-7B DeepSeek-R1-Zero DeepSeek-R1-Distill-Qwen-32B DeepSeek-R1 s1-32B LIMO Grok 3 mini Claude 3.7 Sonnet GPT-4.5 DeepSeek-V3-0324 Gemini 2.5 Pro Seed1.5-Thinking o4-mini Qwen3-235B-A22B Deepseek-R1-0528-Qwen3-8B Deepseek-R1-0528 Magistral Small Magistral Medium GLM-4.5 GLM-4.5-Air Qwen3-1.7B DeepSeek R1 OpenAI o3
Хронология
Дата Модель Результат Источник
2026-07-07 Qwen3-1.7B 62.4% Direct-OPD дистиллирует выгоды слабого к сильному RL для более мощных моделей
2026-03-25 o3 96.7% OpenAI объявляет о выводе o3 из ChatGPT и публикует результаты бенчмарков
2025-08-06 GLM-4.5 91.0% Zhipu AI выпустила модели GLM-4.5, сопоставимые с Claude и DeepSeek
2025-08-06 GLM-4.5-Air 89.4% Zhipu AI выпустила модели GLM-4.5, сопоставимые с Claude и DeepSeek
2025-06-12 Magistral Medium 50.0% Mistral представляет модели рассуждений Magistral с масштабируемым конвейером RL
2025-06-10 Magistral Small 70.7% Mistral AI выпустила модель рассуждений Magistral с открытой и корпоративной версиями
2025-06-10 Magistral Medium 73.6% Mistral AI выпустила модель рассуждений Magistral с открытой и корпоративной версиями
2025-05-30 Deepseek-R1-0528-Qwen3-8B 86.0% DeepSeek обновляет модель R1 с улучшенными способностями к рассуждению и результатами на бенчмарках
2025-05-30 Deepseek-R1-0528 91.4% DeepSeek обновляет модель R1 с улучшенными способностями к рассуждению и результатами на бенчмарках
2025-05-14 Qwen3-235B-A22B 85.7% Qwen3 представляет единый режим рассуждений и поддержку 119 языков
2025-04-17 o4-mini 93.4% OpenAI выпустила o4-mini: более быструю и дешёвую мультимодальную модель рассуждений
2025-04-16 OpenAI o3 91.6% OpenAI
2025-04-10 Seed1.5-Thinking 86.7% Seed1.5-Thinking использует обучение с подкреплением для улучшения рассуждений
2025-03-26 Gemini 2.5 Pro 92.0% Google выпустила экспериментальную модель рассуждений Gemini 2.5 Pro с контекстом на 1 млн токенов
2025-03-24 DeepSeek-V3-0324 59.4% DeepSeek-V3-0324 улучшает рассуждения, программирование и китайское письмо по сравнению с DeepSeek-V3
2025-03-05 GPT-4.5 36.7% OpenAI выпустила GPT-4.5, свою самую большую модель, для ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 80.0% Anthropic выпустила Claude 3.7 Sonnet с динамическим управлением рассуждением
2025-02-19 Grok 3 mini 95.8% xAI выпускает Grok 3 Beta и агента DeepSearch
2025-02-05 LIMO 57.1% GAIR-NLP выпускает LIMO, демонстрируя сильные способности к математическому рассуждению на 817 примерах
2025-01-31 s1-32B 57.0% Лаборатория Simple Scaling выпускает s1-32B с масштабированием во время тестирования через принуждение бюджета
2025-01-31 s1-32B 57.0% s1-32B превосходит o1-preview в соревновательной математике с помощью простого масштабирования во время тестирования
2025-01-22 DeepSeek-R1-Distill-Qwen-7B 55.5% DeepSeek выпускает модели рассуждений R1 с помощью обучения с подкреплением
2025-01-22 DeepSeek-R1-Zero 71.0% DeepSeek выпускает модели рассуждений R1 с помощью обучения с подкреплением
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 72.6% DeepSeek выпускает модели рассуждений R1 с помощью обучения с подкреплением
2025-01-22 DeepSeek-R1 79.8% DeepSeek выпускает модели рассуждений R1 с помощью обучения с подкреплением
2025-01-20 DeepSeek R1 79.8% DeepSeek
2024-12-20 o3 96.7% OpenAI выпустила модель o3 с высокой производительностью в рассуждениях и программировании
2024-11-28 QwQ-32B-Preview 50.0% Qwen выпустила QwQ-32B-Preview, экспериментальную модель рассуждений
2024-10-01 OpenAI o1-preview 83.0% Сравнение OpenAI o1 с другими ведущими моделями
2024-09-12 o1 13.9% OpenAI выпустила o1-preview, модель рассуждений, превосходящую экспертов-людей на тестах по математике и науке