Исследователи представляют CodeElo — стандартизированный бенчмарк, предназначенный для оценки способностей к программированию на уровне соревнований у больших языковых моделей путём интеграции с официальной платформой CodeForces. Бенчмарк устраняет ограничения существующих инструментов за счёт использования реальных задач контестов, поддержки специальных судей и предоставления системы рейтингов Эло, сопоставимой с человеческими участниками.
- CodeElo компилирует недавние задачи контестов CodeForces с указанием дивизионов, уровней сложности и тегов алгоритмов.
- Задачи отправляются непосредственно на платформу для проверки, что обеспечивает соответствие среды выполнения.
- В исследовании впервые предоставляются рейтинги Эло для 30 моделей LLM с открытым исходным кодом и 3 проприетарных моделей.
- Результаты показывают, что o1-mini (1578) и QwQ-32B-Preview (1261) значительно превосходят другие модели, которые испытывают трудности даже с самыми лёгкими задачами.
Этот бенчмарк предлагает надёжный метод оценки сложных способностей к рассуждению в коде и предоставляет информацию о производительности моделей в различных алгоритмах и языках программирования.