Бенчмарк · math

FrontierMath

20 результатов 15 моделей

FrontierMath — это бенчмарк от Epoch AI, который измеряет, насколько хорошо ИИ-модель решает чрезвычайно сложные, оригинальные математические задачи исследовательского уровня. Оценка — это доля правильно решённых задач, и сегодняшние модели решают лишь малую часть, то есть бенчмарк далёк от насыщения.

Подробнее
Пример
Отдельная ранее не публиковавшаяся задача из продвинутой области — например, теории чисел, алгебраической геометрии или комбинаторики, — решение которой требует глубоких знаний и сводится к одному однозначному итоговому ответу (например, конкретному целому числу или точному математическому объекту).
Метрика
Метрика — точность (accuracy): доля задач, у которых итоговый ответ в точности совпадает с эталонным, выраженная в процентах.
Приёмка
У каждой задачи есть один однозначный, автоматически проверяемый ответ, поэтому решение засчитывается только при точном совпадении с эталоном; задачи составлены математиками-экспертами так, что угадать правильный ответ практически невозможно.
Почему важно
Задачи новые, поэтому их нельзя запомнить заранее, и бенчмарк по-прежнему далёк от решения — это один из немногих математических тестов, который чётко отделяет настоящее продвинутое математическое рассуждение от подбора по шаблону.
Разбор примера
Задача
Определите число целых $n$ с $0 \le n < 3^{13}$, для которых центральный биномиальный коэффициент $\binom{2n}{n}$ не делится на $3$.
Решение
По теореме Kummer, $3 \nmid \binom{2n}{n}$ ровно тогда, когда при сложении $n+n$ в системе с основанием 3 нет переносов, то есть каждая цифра числа $n$ в основании 3 равна 0 или 1. На $0 \le n < 3^{13}$ это даёт по 2 варианта для каждой из 13 цифр, поэтому количество равно $2^{13} = 8192$.
Разбор
Теорема Kummer даёт $v_3\binom{2n}{n}$ как число переносов при сложении $n$ с самим собой в основании 3; отсутствие переносов требует, чтобы каждая цифра в основании 3 была 0 или 1, то есть 2 варианта на цифру для 13 цифр. Оценивание: автоматический проверщик точно сверяет единственное итоговое целое число (8192).
0 14 28 42 56 2024-11-08 2025-08-01 2026-04-25 Claude 3.5 Sonnet · 2 · 2024-11-08 Gemini 1.5 Pro · 2 · 2024-11-08 GPT-4o · 2 · 2024-11-08 o1-preview · 2 · 2024-11-08 o3 · 25 · 2024-12-20 o3 · 25 · 2024-12-22 o3 · 25.2 · 2025-01-19 o3 · 25 · 2025-01-29 o3 · 10 · 2025-04-20 o3-mini with high reasoning and a Python tool · 32 · 2025-03-17 Gemini 2.5 Deep Think · 29 · 2025-10-09 GPT-5 Pro · 13 · 2025-10-13 Claude 4.5 Opus · 21 · 2025-12-04 Gemini 3 Pro · 38 · 2025-12-04 GPT-5.2 Thinking · 40.3 · 2025-12-11 GPT-5.2 Pro · 31 · 2026-01-23 GPT-5.5 Pro · 39.6 · 2026-04-23 GPT-5.5 · 35.4 · 2026-04-23 GPT-5.5 · 51.7 · 2026-04-25 OpenAI o3 · 25.2 · 2024-12-20
Claude 3.5 Sonnet Gemini 1.5 Pro GPT-4o o1-preview o3 o3-mini with high reasoning and a Python tool Gemini 2.5 Deep Think GPT-5 Pro Claude 4.5 Opus Gemini 3 Pro GPT-5.2 Thinking GPT-5.2 Pro GPT-5.5 Pro GPT-5.5 OpenAI o3
Хронология
Дата Модель Результат Источник
2026-04-25 GPT-5.5 51.7% OpenAI выпустила GPT-5.5: модель с нуля переобученная для нативной омнимодальной обработки
2026-04-23 GPT-5.5 Pro 39.6% OpenAI выпустила GPT-5.5 с агентными возможностями и удвоенной ценой API
2026-04-23 GPT-5.5 35.4% OpenAI выпустила GPT-5.5 с агентными возможностями и удвоенной ценой API
2026-01-23 GPT-5.2 Pro 31.0% GPT-5.2 Pro набрал 31% на FrontierMath Tier 4
2025-12-11 GPT-5.2 Thinking 40.3% OpenAI выпустила модели GPT-5.2 Pro и Thinking для науки и математики
2025-12-04 Claude 4.5 Opus 21.0% Epoch AI запускает Центр передовых дата-центров и анализирует бенчмарк OSWorld
2025-12-04 Gemini 3 Pro 38.0% Epoch AI запускает Центр передовых дата-центров и анализирует бенчмарк OSWorld
2025-10-13 GPT-5 Pro 13.0% GPT-5 Pro решает задачу уровня Tier 4 из FrontierMath, опережая Gemini 2.5 Deep Think
2025-10-09 Gemini 2.5 Deep Think 29.0% Epoch AI оценила математические способности Gemini 2.5 Deep Think
2025-04-20 o3 10.0% Результаты OpenAI o3 на FrontierMath оказались ниже первоначально заявленных
2025-03-17 o3-mini with high reasoning and a Python tool 32.0% Оценка Epoch модели o3-mini на FrontierMath: 11% против 32% от OpenAI
2025-01-29 o3 25.0% Модель o3 от OpenAI набрала 25% на бенчмарке Frontier Math
2025-01-19 o3 25.2% OpenAI профинансировала бенчмарк FrontierMath до того, как o3 установил рекорд
2024-12-22 o3 25.0% OpenAI o3 набрал 25% на сложном математическом бенчмарке FrontierMath
2024-12-20 o3 25.0% OpenAI демонстрирует модель рассуждений o3 с прорывами в ARC AGI и Frontier Math
2024-12-20 OpenAI o3 25.2% Epoch AI
2024-11-08 Claude 3.5 Sonnet 2.0% Epoch AI выпустила бенчмарк FrontierMath для оценки продвинутого математического рассуждения
2024-11-08 Gemini 1.5 Pro 2.0% Epoch AI выпустила бенчмарк FrontierMath для оценки продвинутого математического рассуждения
2024-11-08 GPT-4o 2.0% Epoch AI выпустила бенчмарк FrontierMath для оценки продвинутого математического рассуждения
2024-11-08 o1-preview 2.0% Epoch AI выпустила бенчмарк FrontierMath для оценки продвинутого математического рассуждения