Авторы выявляют, что застой показателей на бенчмарке SciCode обусловлен существенными дефектами инструмента оценки, а не ограничениями возможностей моделей. Аудит 65 тестовых задач экспертами в предметной области выявил 263 дефекта, из которых 192 приводили к неверному отклонению правильных решений из-за таких проблем, как невозможность воспроизведения эталонных ответов и чрезмерно жесткие допуски.

  • Команда исправила каждый подтвержденный дефект, создав SciCode-Verified, добавив необходимые спецификации и восстановив логику оценивания.
  • Повторная оценка двенадцати снимков состояний передовых моделей на исправленном бенчмарке показала рост точности решения подзадач с 45–60% до 84–98%.
  • Точность решения основных задач значительно увеличилась с 9–27% до 69–92%, демонстрируя, что модели передового уровня гораздо более компетентны, чем предполагалось ранее.

Авторы публикуют SciCode-Verified вместе с его полной аудиторской трассой в качестве исправленного публичного стандарта, устанавливая, что предыдущим узким местом было качество инструмента оценки.