Новая языковая модель OpenAI, o3, показала результат в 25% на FrontierMath — закрытом наборе данных, содержащем сотни сложных математических задач, подготовленных организацией Epoch AI. Набор данных состоит из задач с однозначными вычислимыми ответами, которые можно автоматически проверить; это сделано для того, чтобы модели не могли просто запоминать публичные решения.

  • FrontierMath содержит «сотни» сложных математических задач: изначально было опубликовано менее 200 вопросов, позже добавились новые.
  • Пять общедоступных примеров требуют ответов в виде положительных целых чисел, таких как 9811 и 367707, и включают сложные концепции, такие как p-адическая непрерывность и гипотезы Вейля.
  • Автор смог решить две из пяти публичных задач, опираясь на свои знания арифметики, но отметил, что типичный талантливый студент-математик бакалавриата, вероятно, испытает трудности даже с одной из них.
  • Эллиот Глейзер из Epoch AI предположил, что 25% набора данных состоят из задач «в стиле олимпиадных или университетских», что вызывает вопросы об общем уровне сложности и репрезентативности публичных примеров.

Это достижение значимо, потому что область ИИ для математики страдает от нехватки сложных наборов данных, а создание таких бенчмарков затруднительно и дорого. Автор выразил удивление результатом, отметив, что хотя ИИ быстро улучшает свои показатели на задачах олимпиадного типа, достижение уровня инноваций, характерного для продвинутых студентов бакалавриата или аспирантов, ранее считалось отдаленной целью.