Бенчмарк · math

AIME 2025

31 результатов 27 моделей

AIME 2025 проверяет продвинутое математическое рассуждение модели на 15 задачах American Invitational Mathematics Examination 2025 года — сложной школьной олимпиады. Ответом на каждую задачу служит целое число от 0 до 999, а оценка модели — это процент правильно решённых задач (обычно приводится как pass@1 или avg@k).

Подробнее
Пример
Типичный пункт — сложная олимпиадная задача, например по теории чисел или комбинаторике, ответом на которую служит одно целое число от 0 до 999, скажем, найти количество упорядоченных пар, удовлетворяющих заданному набору алгебраических условий.
Метрика
Каждая из 15 задач оценивается по точному совпадению целочисленного ответа, а итог — это доля (процент) верно решённых; поскольку ответы меняются от запуска к запуску, результат обычно усредняют по многим прогонам (avg@k) или приводят как pass@1.
Приёмка
Проверка автоматическая и объективная: итоговое целое число модели сравнивается с официальным ключом ответов без частичных баллов и без участия человека, поэтому решение засчитывается только при точном числовом совпадении.
Почему важно
Задачи AIME требуют многошагового творческого рассуждения, а не запоминания, поэтому этот бенчмарк — широко отслеживаемый показатель математических способностей передовых LLM и частая заметная цифра при выходе новых моделей рассуждения.
Разбор примера
Задача
Типичная задача в стиле AIME (ответ — целое число от 0 до 999): найдите сумму всех натуральных чисел n, для которых √(n² + 85n + 2017) является целым числом.
Решение
Выделим полный квадрат: (2m)² − (2n+85)² = 843 = 3·281. Разложим разность квадратов: (2m−2n−85)(2m+2n+85) = 843, откуда n = 168 или n = 27. Сумма = 168 + 27 = 195.
Разбор
Выделение полного квадрата сводит условие к разности квадратов (2m)² − (2n+85)² = 843 = 3·281, единственные положительные разложения которой дают n = 168 и n = 27, в сумме 195. AIME оценивается по точному совпадению единственного целого ответа (0–999), без частичных баллов.
0 25 50 75 100 2025-01-22 2025-10-17 2026-07-13 Kimi k1.5 (short-CoT) · 60.8 · 2025-01-22 Kimi k1.5 · 77.5 · 2025-01-22 Grok 3 (Think) · 93.3 · 2025-02-19 Grok 3 Beta · 93.3 · 2025-02-26 OpenAI o3-mini · 83.3 · 2025-02-26 DeepSeek R1 · 79.8 · 2025-02-26 Claude 3.7 Sonnet · 61.3 · 2025-02-26 Claude 3.5 Sonnet · 41.3 · 2025-02-26 Grok 3 · 93.3 · 2025-03-11 Gemini 2.5 Pro (experimental) · 86.7 · 2025-03-25 Gemini 2.5 Pro · 86.7 · 2025-03-26 OpenAI o3 · 98.4 · 2025-04-16 OpenAI o4-mini · 99.5 · 2025-04-16 o4-mini · 92.7 · 2025-04-17 Qwen3-235B-A22B · 81.5 · 2025-05-14 DeepSeek-R1-0528 · 87.5 · 2025-05-28 Deepseek-R1-0528 · 87.5 · 2025-05-30 Grok 4 · 88 · 2025-07-25 Kimi K2 · 49.5 · 2025-07-28 Kimi K2 · 49.5 · 2025-07-28 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GLM-4.6 · 93.9 · 2025-09-30 Claude Sonnet 4.5 · 100 · 2025-09-30 Kimi K2.5 · 96.1 · 2026-01-27 o1-pro · 86 · 2026-05-14 Agents-A1 · 79 · 2026-06-30 DASH · 50.8 · 2026-07-05 Mach-Mind-4-Flash · 92.7 · 2026-07-13 Mach-Mind-4-Flash · 92.7 · 2026-07-13
Kimi k1.5 (short-CoT) Kimi k1.5 Grok 3 (Think) Grok 3 Beta OpenAI o3-mini DeepSeek R1 Claude 3.7 Sonnet Claude 3.5 Sonnet Grok 3 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro OpenAI o3 OpenAI o4-mini o4-mini Qwen3-235B-A22B DeepSeek-R1-0528 Deepseek-R1-0528 Grok 4 Kimi K2 GPT-5 GLM-4.6 Claude Sonnet 4.5 Kimi K2.5 o1-pro Agents-A1 DASH Mach-Mind-4-Flash
Хронология
Дата Модель Результат Источник
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: 35B MoE agentic модель сопоставима с более крупными моделями благодаря оптимизации после обучения
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: 35B MoE агентная модель достигает уровня более крупных моделей благодаря оптимизации после обучения
2026-07-05 DASH 50.8% DASH снижает чрезмерное обдумывание в языковых моделях рассуждения через присвоение кредита на уровне сегментов
2026-06-30 Agents-A1 79.0pts Масштабирование горизонта, а не параметров: достижение производительности триллионных моделей с агентом на 35B
2026-05-14 o1-pro 86.0% OpenAI выпускает семейство o1, устанавливая эру рассуждений с вычислениями во время вывода
2026-01-27 Kimi K2.5 96.1% Moonshot выпустила Kimi K2.5 с технологией Agent Swarm
2025-09-30 GLM-4.6 93.9% Zhipu AI выпустила GLM-4.6 с агентными возможностями и контекстным окном на 128k токенов
2025-09-30 Claude Sonnet 4.5 100.0% Anthropic выпустила Claude Sonnet 4.5 с улучшенными возможностями программирования и агентов
2025-08-07 GPT-5 94.6% OpenAI запускает GPT-5 с адаптивным рассуждением и единой архитектурой
2025-08-07 GPT-5 94.6% OpenAI представляет GPT-5 с единым маршрутизатором и рассуждениями экспертного уровня
2025-08-07 GPT-5 94.6% OpenAI
2025-07-28 Kimi K2 49.5% Kimi K2: открытая MoE-модель с 1T параметров и оптимизатором MuonClip
2025-07-28 Kimi K2 49.5% Moonshot выпустила Kimi K2, открытую агентную MoE-модель с 32B активных параметров
2025-07-25 Grok 4 88.0% Epoch AI оценивает математические способности Grok 4
2025-05-30 Deepseek-R1-0528 87.5% DeepSeek обновляет модель R1 с улучшенными способностями к рассуждению и результатами на бенчмарках
2025-05-28 DeepSeek-R1-0528 87.5% DeepSeek-R1-0528 улучшает рассуждения и точность AIME до 87,5%
2025-05-14 Qwen3-235B-A22B 81.5% Qwen3 представляет единый режим рассуждений и поддержку 119 языков
2025-04-17 o4-mini 92.7% OpenAI выпустила o4-mini: более быструю и дешёвую мультимодальную модель рассуждений
2025-04-16 OpenAI o3 98.4% OpenAI выпустила модели o3 и o4-mini для рассуждений с агентным использованием инструментов
2025-04-16 OpenAI o4-mini 99.5% OpenAI выпустила модели o3 и o4-mini для рассуждений с агентным использованием инструментов
2025-03-26 Gemini 2.5 Pro 86.7% Google выпустила экспериментальную модель рассуждений Gemini 2.5 Pro с контекстом на 1 млн токенов
2025-03-25 Gemini 2.5 Pro (experimental) 86.7% Google DeepMind выпустила экспериментальную модель Gemini 2.5 Pro
2025-03-11 Grok 3 93.3% xAI выпустила Grok 3 с глубоким рассуждением и контекстом на миллион токенов
2025-02-26 Grok 3 Beta 93.3% Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
2025-02-26 OpenAI o3-mini 83.3% Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
2025-02-26 DeepSeek R1 79.8% Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
2025-02-26 Claude 3.7 Sonnet 61.3% Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 41.3% Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
2025-02-19 Grok 3 (Think) 93.3% xAI выпускает Grok 3 Beta и агента DeepSearch
2025-01-22 Kimi k1.5 (short-CoT) 60.8% Kimi k1.5 масштабирует обучение с подкреплением на основе LLM для достижения уровня o1 и превосходства над моделями с коротким цепочечным мышлением
2025-01-22 Kimi k1.5 77.5% Kimi k1.5 масштабирует обучение с подкреплением на основе LLM для достижения уровня o1 и превосходства над моделями с коротким цепочечным мышлением