OpenAI предоставила финансирование независимого математического бенчмарка FrontierMath, будучи связанной соглашением о неразглашении, которое запрещало Epoch AI раскрывать эту информацию до тех пор, пока OpenAI не объявила о рекордных результатах своей модели o3. Бенчмарк, разработанный более чем 60 математиками, проверяет навыки сложного логического мышления, и модель o3 от OpenAI достигла на нём уровня успеха в 25,2 процента.

  • FrontierMath был представлен в ноябре 2024 года для оценки продвинутых способностей к решению математических задач.
  • Epoch AI подписала соглашение, запрещающее раскрытие финансовой поддержки со стороны OpenAI до объявления о модели o3 20 декабря.
  • Задачи бенчмарка были созданы командой из более чем 60 ведущих математиков, которые не знали об источнике финансирования.
  • OpenAI получила доступ к «большой, но не всей» части данных FrontierMath, хотя устное соглашение запрещало использование материалов для обучения модели.
  • Epoch AI признаёт отсутствие прозрачности ошибкой и обещает предоставлять более чёткую информацию об источниках финансирования в будущих совместных проектах.

Ситуация подчеркивает сложность бенчмаркинга в области ИИ и важность прозрачности, особенно учитывая, что математическое логическое мышление является серьёзным недостатком языковых моделей.