Pesquisadores apresentam o CodeElo, um benchmark padronizado projetado para avaliar as habilidades de codificação em nível competitivo de grandes modelos de linguagem, alinhando-se à plataforma oficial do CodeForces. O benchmark aborda limitações nas ferramentas existentes ao utilizar problemas reais de competições, suportar juízes especiais e fornecer um sistema de classificação Elo comparável aos participantes humanos.

  • O CodeElo compila problemas recentes das competições do CodeForces com detalhes sobre divisões, classificações de dificuldade e tags de algoritmo.
  • Os problemas são submetidos diretamente à plataforma para julgamento, garantindo alinhamento com o ambiente de execução.
  • O estudo fornece pela primeira vez classificações Elo para 30 LLMs de código aberto e 3 proprietários.
  • Os resultados mostram que o o1-mini (1578) e o QwQ-32B-Preview (1261) superam significativamente outros modelos, que têm dificuldades até mesmo com os problemas mais fáceis.

Este benchmark oferece um método confiável para avaliar capacidades sofisticadas de raciocínio em código e fornece insights sobre o desempenho dos modelos em diferentes algoritmos e linguagens de programação.