Независимые результаты бенчмарка, опубликованные Epoch AI, показывают, что публично запущенная модель o3 от OpenAI набрала около 10% на наборе данных FrontierMath, значительно уступив показателю более 25%, который компания изначально выделила во время своего анонса в декабре.
- Epoch AI оценила выпущенную модель o3 с использованием обновленной версии бенчмарка FrontierMath и получила результат около 10%.
- Первоначальное утверждение OpenAI о результате более 25% было достигнуто при использовании агрессивных настроек вычислений во время тестирования на более мощном внутреннем стенде, чем в публичной версии.
- Фонд ARC Prize Foundation подтвердил, что публичная версия o3 настроена для чата и использования в продуктах, с меньшими объемами вычислений по сравнению с версией для предварительного просмотра, которую они тестировали.
- Технические специалисты OpenAI заявили, что производственная модель оптимизирована для экономии затрат и скорости, а не для достижения максимальной производительности в бенчмарках.
Расхождение подчеркивает важность проверки сторонних бенчмарков и проясняет, что выпущенная модель приоритизирует реальную полезность над пиковыми академическими результатами.