Независимые результаты бенчмарка, опубликованные Epoch AI, показывают, что публично запущенная модель o3 от OpenAI набрала около 10% на наборе данных FrontierMath, значительно уступив показателю более 25%, который компания изначально выделила во время своего анонса в декабре.

  • Epoch AI оценила выпущенную модель o3 с использованием обновленной версии бенчмарка FrontierMath и получила результат около 10%.
  • Первоначальное утверждение OpenAI о результате более 25% было достигнуто при использовании агрессивных настроек вычислений во время тестирования на более мощном внутреннем стенде, чем в публичной версии.
  • Фонд ARC Prize Foundation подтвердил, что публичная версия o3 настроена для чата и использования в продуктах, с меньшими объемами вычислений по сравнению с версией для предварительного просмотра, которую они тестировали.
  • Технические специалисты OpenAI заявили, что производственная модель оптимизирована для экономии затрат и скорости, а не для достижения максимальной производительности в бенчмарках.

Расхождение подчеркивает важность проверки сторонних бенчмарков и проясняет, что выпущенная модель приоритизирует реальную полезность над пиковыми академическими результатами.