Epoch AI представила FrontierMath — бенчмарк, состоящий из сотен оригинальных задач по математике, созданных экспертами, предназначенных для оценки возможностей продвинутого рассуждения в системах ИИ. Задачи разработаны совместно с более чем 60 математиками, включая лауреатов Филдсовской премии, и охватывают современные области исследований, такие как теория чисел и алгебраическая геометрия; их решение обычно требует от экспертов часов или дней.
- Бенчмарк включает задачи, устойчивые к угадыванию («guessproof»), которые можно автоматически проверить с помощью вычислений.
- Оценка шести ведущих моделей, включая Claude 3.5 Sonnet и GPT-4o, показала, что ни одна из них не смогла решить более 2% задач, несмотря на наличие обширных вспомогательных фреймворков.
- Эта производительность резко контрастирует с бенчмарками вроде GSM-8K, где лучшие модели достигают точности свыше 90%.
- Epoch AI планирует проводить регулярные оценки, расширять бенчмарк и выпускать дополнительные задачи в ближайшие месяцы.
FrontierMath призван обеспечить стандартизированную меру прогресса в математическом рассуждении на уровне исследований по мере развития систем ИИ, подчеркивая существенный разрыв между текущими возможностями ИИ и экспертами-математиками.