OpenAI объявила о выпуске o3, своей модели следующего поколения для рассуждений, которая устанавливает новые рекорды в области логических выводов, программирования и решения математических задач. Модель достигает результата 75,7% на полузакрытом тесте ARC-AGI eval в режиме с низкими вычислительными затратами и 87,5% в режиме с высокими вычислительными затратами.

  • o3 набирает 75,7% на ARC-AGI (низкие вычисления) и 87,5% (высокие вычисления), превосходя порог человеческого уровня в 85%.
  • Она достигает результата 96,7% на Американской математической олимпиаде 2024 года (AIME) и 25,2% на Frontier Math Benchmark от EpochAI.
  • В области программирования o3 набирает 71,7 на SWE-Bench Verified (на 22,8 балла выше, чем o1) и имеет рейтинг Эло 2727 на Codeforces.
  • Модель имеет контекстное окно на 128K токенов и отличается значительно более высокой стоимостью запуска по сравнению с предыдущими версиями.