OpenAI представила предварительную версию своей новой языковой модели рассуждений o3, что сигнализирует о быстром прогрессе в возможностях ИИ перед публичным релизом в конце января 2025 года. В объявлении подчеркиваются значительные скачки производительности по сравнению с предыдущими моделями уровня state-of-the-art, такими как Gemini 1.5 Pro и Claude 3.5 Sonnet.

  • o3 стала первой моделью, преодолевшей порог в 85% на публичном наборе данных ARC AGI prize, бенчмарке, предназначенном для измерения человекоподобной гибкой интеллигенции.
  • Она набирает 25% баллов на бенчмарке Frontier Math, что является существенным увеличением по сравнению с предыдущим уровнем state-of-the-art в 2%.
  • Модель достигает уровня международного гроссмейстера по производительности на Codeforces и устанавливает новый рекорд на SWE-Bench-Verified с результатом 71.7%.
  • OpenAI также опубликовала исследование по deliberative alignment, демонстрирующее, как модели класса o1 могут улучшать исследования в области безопасности и выравнивания.

Эти результаты указывают на то, что модели рассуждений начинают приносить пользу за пределами верифицируемых областей, таких как математика и программирование, потенциально ускоряя прогресс во всей экосистеме исследований ИИ.