Investigadores presentan CodeElo, un benchmark estandarizado diseñado para evaluar las capacidades de codificación a nivel competitivo de modelos de lenguaje grandes alineándose con la plataforma oficial de CodeForces. El benchmark aborda limitaciones en herramientas existentes mediante el uso de problemas reales de concursos, soporte para jueces especiales y un sistema de calificaciones Elo comparable al de participantes humanos.
- CodeElo compila problemas recientes de CodeForces con detalles sobre divisiones, calificaciones de dificultad y etiquetas algorítmicas.
- Los problemas se envían directamente a la plataforma para su evaluación, asegurando la alineación del entorno de ejecución.
- El estudio proporciona por primera vez calificaciones Elo para 30 LLMs de código abierto y 3 propietarios.
- Los resultados muestran que o1-mini (1578) y QwQ-32B-Preview (1261) superan significativamente a otros modelos, los cuales tienen dificultades incluso con los problemas más fáciles.
Este benchmark ofrece un método fiable para evaluar capacidades sofisticadas de razonamiento de código y proporciona información sobre el rendimiento del modelo en diferentes algoritmos y lenguajes de programación.