Benchmark · coding

Codeforces (Elo)

10 条结果 10 个模型

Codeforces (Elo) 通过让模型解决限时竞赛题来衡量其竞技编程能力,结果以 Codeforces Elo 评分表示(大致为 0–4000,约 2000 以上即为很强)。

了解更多
示例
典型题目是一道限时算法题——例如,读取题目的输入并在严格的时间和内存限制内输出正确答案,使用图搜索、动态规划或贪心算法等技巧。
评分方式
结果是一个 Elo 数值,根据模型解出的竞赛题数量及其难度计算得出,并映射到 Codeforces 为人类选手使用的同一评分刻度上。
验证方式
每份提交的解答都由系统自动评判:代码会被编译并在一组隐藏的测试用例上运行,只有在时间和内存限制内输出正确答案才算通过。
为何重要
它体现了多步骤的算法推理以及在约束下写出正确、高效代码的能力,并把模型的编程水平映射到人们已经熟悉的评分刻度上。
示例解析
任务
Watermelon:给定一个整数 w(1 ≤ w ≤ 100),表示一个西瓜的重量,判断能否将它分成两部分,使每部分都重正的偶数千克。输出「YES」或「NO」。
解答
w = int(input())
print("YES" if w > 2 and w % 2 == 0 else "NO")
解析
两个正偶数之和本身是偶数且至少为 4,因此当且仅当 w 为偶数且 w > 2 时存在合法的划分(例如 w=8 → 2+6)。Codeforces 通过编译提交并在隐藏测试用例上运行来评分,要求在时间和内存限制内输出与预期完全一致的 stdout。
88 1016 1944 2872 3800 2024-09-12 2025-08-14 2026-07-16 o1 · 1807 · 2024-09-12 OpenAI o1-preview · 89 · 2024-10-01 o3 · 2727 · 2024-12-20 QwQ-32B-Preview · 1261 · 2025-01-02 o1-mini · 1578 · 2025-01-02 DeepSeek-R1 · 2029 · 2025-01-22 o4-mini · 2719 · 2025-04-17 Qwen3-235B-A22B · 2056 · 2025-05-14 Gemini 3 Deep Think · 3455 · 2026-02-12 GFlowRL · 2048 · 2026-07-16
o1 OpenAI o1-preview o3 QwQ-32B-Preview o1-mini DeepSeek-R1 o4-mini Qwen3-235B-A22B Gemini 3 Deep Think GFlowRL
时间线
日期 模型 得分 来源
2026-07-16 GFlowRL 2048.0Elo 微软发布 GFlowRL,一种用于大语言模型的稳定 GFlowNet 风格强化学习算法
2026-02-12 Gemini 3 Deep Think 3455.0Elo Google 发布升级版 Gemini 3 Deep Think,附带新的基准测试成绩
2025-05-14 Qwen3-235B-A22B 2056.0Elo Qwen3 引入统一思维模式并支持 119 种语言
2025-04-17 o4-mini 2719.0Elo OpenAI发布o4-mini:一款更快、更便宜的多模态推理模型
2025-01-22 DeepSeek-R1 2029.0Elo DeepSeek 通过强化学习发布 R1 推理模型
2025-01-02 QwQ-32B-Preview 1261.0Elo CodeElo 推出具备人类可比 Elo 评分的竞赛级代码生成基准
2025-01-02 o1-mini 1578.0Elo CodeElo 推出具备人类可比 Elo 评分的竞赛级代码生成基准
2024-12-20 o3 2727.0Elo OpenAI 发布 o3 模型,在推理和编程方面表现卓越
2024-10-01 OpenAI o1-preview 89.0Elo 比较 OpenAI o1 与其他顶级模型
2024-09-12 o1 1807.0Elo OpenAI发布o1-preview,一款在数学和科学基准测试中超越人类专家的推理模型