OpenAI утверждает, что его модель o3-mini с высокими способностями к рассуждению и доступом к инструментам Python достигает 32% на бенчмарке FrontierMath. Однако официальная независимая оценка Epoch показывает значительно более низкий результат — всего 11%.
- Epoch создала этот бенчмарк и имеет лучшие стимулы для точного подсчета очков.
- OpenAI сообщила о результате 28% на самом сложном уровне задач, что подозрительно близко к ее общему результату.
- Epoch опубликовала обширную информацию о своей тестовой инфраструктуре и данных, тогда как OpenAI опубликовала мало.
- Расхождение может быть связано с тем, что OpenAI использует более мощный внутренний каркас, больше вычислений на этапе тестирования или другой набор задач (180 против 290).
Разница в результатах подчеркивает важность прозрачных методологий оценки и независимой проверки при бенчмаркинге больших языковых моделей.