Benchmark · coding
Codeforces (Elo)
Codeforces (Elo) 通过让模型解决限时竞赛题来衡量其竞技编程能力,结果以 Codeforces Elo 评分表示(大致为 0–4000,约 2000 以上即为很强)。
了解更多
- 示例
- 典型题目是一道限时算法题——例如,读取题目的输入并在严格的时间和内存限制内输出正确答案,使用图搜索、动态规划或贪心算法等技巧。
- 评分方式
- 结果是一个 Elo 数值,根据模型解出的竞赛题数量及其难度计算得出,并映射到 Codeforces 为人类选手使用的同一评分刻度上。
- 验证方式
- 每份提交的解答都由系统自动评判:代码会被编译并在一组隐藏的测试用例上运行,只有在时间和内存限制内输出正确答案才算通过。
- 为何重要
- 它体现了多步骤的算法推理以及在约束下写出正确、高效代码的能力,并把模型的编程水平映射到人们已经熟悉的评分刻度上。
示例解析
任务
Watermelon:给定一个整数 w(1 ≤ w ≤ 100),表示一个西瓜的重量,判断能否将它分成两部分,使每部分都重正的偶数千克。输出「YES」或「NO」。
解答
w = int(input())
print("YES" if w > 2 and w % 2 == 0 else "NO")
解析
两个正偶数之和本身是偶数且至少为 4,因此当且仅当 w 为偶数且 w > 2 时存在合法的划分(例如 w=8 → 2+6)。Codeforces 通过编译提交并在隐藏测试用例上运行来评分,要求在时间和内存限制内输出与预期完全一致的 stdout。
| 日期 | 模型 | 得分 | 来源 |
|---|---|---|---|
| 2026-07-16 | GFlowRL | 2048.0Elo | 微软发布 GFlowRL,一种用于大语言模型的稳定 GFlowNet 风格强化学习算法 |
| 2026-02-12 | Gemini 3 Deep Think | 3455.0Elo | Google 发布升级版 Gemini 3 Deep Think,附带新的基准测试成绩 |
| 2025-05-14 | Qwen3-235B-A22B | 2056.0Elo | Qwen3 引入统一思维模式并支持 119 种语言 |
| 2025-04-17 | o4-mini | 2719.0Elo | OpenAI发布o4-mini:一款更快、更便宜的多模态推理模型 |
| 2025-01-22 | DeepSeek-R1 | 2029.0Elo | DeepSeek 通过强化学习发布 R1 推理模型 |
| 2025-01-02 | QwQ-32B-Preview | 1261.0Elo | CodeElo 推出具备人类可比 Elo 评分的竞赛级代码生成基准 |
| 2025-01-02 | o1-mini | 1578.0Elo | CodeElo 推出具备人类可比 Elo 评分的竞赛级代码生成基准 |
| 2024-12-20 | o3 | 2727.0Elo | OpenAI 发布 o3 模型,在推理和编程方面表现卓越 |
| 2024-10-01 | OpenAI o1-preview | 89.0Elo | 比较 OpenAI o1 与其他顶级模型 |
| 2024-09-12 | o1 | 1807.0Elo | OpenAI发布o1-preview,一款在数学和科学基准测试中超越人类专家的推理模型 |