OpenAI представила предварительную версию своей новой языковой модели рассуждений o3, что сигнализирует о быстром прогрессе в возможностях ИИ перед публичным релизом в конце января 2025 года. В объявлении подчеркиваются значительные скачки производительности по сравнению с предыдущими моделями уровня state-of-the-art, такими как Gemini 1.5 Pro и Claude 3.5 Sonnet.
- o3 стала первой моделью, преодолевшей порог в 85% на публичном наборе данных ARC AGI prize, бенчмарке, предназначенном для измерения человекоподобной гибкой интеллигенции.
- Она набирает 25% баллов на бенчмарке Frontier Math, что является существенным увеличением по сравнению с предыдущим уровнем state-of-the-art в 2%.
- Модель достигает уровня международного гроссмейстера по производительности на Codeforces и устанавливает новый рекорд на SWE-Bench-Verified с результатом 71.7%.
- OpenAI также опубликовала исследование по deliberative alignment, демонстрирующее, как модели класса o1 могут улучшать исследования в области безопасности и выравнивания.
Эти результаты указывают на то, что модели рассуждений начинают приносить пользу за пределами верифицируемых областей, таких как математика и программирование, потенциально ускоряя прогресс во всей экосистеме исследований ИИ.