OpenAI объявила о своей новой модели o3, которая показала результат 25% на бенчмарке Frontier Math, что является значительным скачком по сравнению со средним показателем в 2% для генеративных ИИ. Этот результат подчеркивает быстрые улучшения в способности ИИ к математическому рассуждению.

  • Frontier Math — это закрытый бенчмарк с сложными математическими вопросами, предназначенный для проверки способностей, похожих на человеческие, без опоры на заученные данные.
  • Модель o3 использует итерационные цепочки размышлений, позволяющие ей оценивать и исправлять собственные шаги рассуждения перед ответом.
  • Этот процесс требует значительных вычислительных ресурсов, при этом стоимость ответа на некоторые отдельные вопросы превышает 1000 долларов.
  • В отличие от специализированных моделей, таких как AlphaProof от Google DeepMind, o3 является общим ИИ, демонстрирующим продвинутые математические навыки.

В статье предполагается, что если затраты снизятся, а результаты улучшатся, ИИ-математики могут трансформировать формальные методы, автоматизируя процессы верификации, которые в настоящее время ограничены нехваткой человеческих экспертов.