Исследование, проверяющее шесть широко используемых физических бенчмарков, выявило, что низкие результаты, сообщаемые для передовых языковых моделей, в значительной степени обусловлены ошибками бенчмаркинга, а не недостатками самих моделей. Эксперты проанализировали формулировки задач, эталонные решения и ответы моделей, отделив реальные ошибки от ошибок оценщиков, неверных ссылок и неоднозначных вопросов.
- Средний результат GPT-5.6-Sol@4 на HLE-Physics вырос с 47,3% до 78,7% после исправления.
- Его результат на CMT-Benchmark увеличился с 61,0% до 87,2% после экспертной проверки.
- Модель достигла скорректированного pass@4 в 94,4% на 54 сохранённых задачах CritPt.
- Результаты на UGPhysics, PRISM-Physics и PHYBench также значительно выросли после аудита.
Полученные данные указывают на то, что текущие бенчмарки существенно занижают способность передовых моделей решать корректно поставленные физические задачи, подчёркивая необходимость более сложных оценок, проверенных экспертами.