研究人员推出了 CodeElo,这是一个标准化基准,旨在通过与官方 CodeForces 平台对齐来评估大型语言模型的竞赛级编码能力。该基准通过使用真实的竞赛题目、支持特殊裁判以及提供与人类参与者相当的 Elo 评级系统,解决了现有工具的局限性。

  • CodeElo 编译了最近的 CodeForces 竞赛题目,包含组别、难度评分和算法标签等详细信息。
  • 题目直接提交至平台进行评判,确保执行环境的一致性。
  • 该研究首次为 30 个开源模型和 3 个专有 LLM 提供了 Elo 评分。
  • 结果显示,o1-mini (1578) 和 QwQ-32B-Preview (1261) 显著优于其他模型,后者甚至在最简单的问题上也表现挣扎。

该基准提供了一种可靠的方法来评估复杂的代码推理能力,并提供了关于模型在不同算法和编程语言中性能表现的见解。