Les chercheurs présentent CodeElo, un benchmark standardisé conçu pour évaluer les capacités de codage au niveau compétitif des grands modèles de langage en s'alignant sur la plateforme officielle CodeForces. Le benchmark comble les lacunes des outils existants en utilisant de véritables problèmes de concours, en prenant en charge des juges spéciaux et en fournissant un système de cotes Elo comparable à celui des participants humains.

  • CodeElo compile les récents problèmes des concours CodeForces avec des détails sur les divisions, les niveaux de difficulté et les balises algorithmiques.
  • Les problèmes sont soumis directement à la plateforme pour évaluation, garantissant l'alignement de l'environnement d'exécution.
  • L'étude fournit pour la première fois des cotes Elo pour 30 modèles de langage open-source et 3 propriétaires.
  • Les résultats montrent que o1-mini (1578) et QwQ-32B-Preview (1261) surpassent significativement les autres modèles, qui peinent même avec les problèmes les plus simples.

Ce benchmark offre une méthode fiable pour évaluer les capacités de raisonnement code sophistiquées et fournit des informations sur la performance des modèles à travers différents algorithmes et langages de programmation.