Benchmark · coding

LiveCodeBench

20 条结果 18 个模型

LiveCodeBench 评估大型语言模型解决 competitive programming 题目的能力,其题目持续从近期的比赛中收集,以避免训练数据污染。核心指标是 pass@1,即模型第一次尝试就正确解出的题目所占的比例。

了解更多
示例
一个典型的题目是比赛风格的编程题——例如,给定一个整数数组,编写一个函数返回最长严格递增子序列的长度——模型必须通过生成可运行的代码来解决它。
评分方式
每个生成的解答都会在该题的测试用例上运行;pass@1 就是模型首次提交即通过全部测试的题目所占的比例。
验证方式
当生成的代码通过该题所有隐藏和公开的测试用例时,解答会被自动接受;不涉及人工评判或精确文本匹配。
为何重要
由于其题目取自模型训练截止之后发布的比赛,LiveCodeBench 衡量的是真正的推理和编程能力,而非背下来的答案,因此成为一个可信且抗污染的编程能力衡量标准。
示例解析
任务
竞赛编程风格(stdin/stdout)。给定 n 个整数,统计满足 i < j 且 nums[i] + nums[j] 为偶数的数对 (i, j) 的个数。输入:第一行是 n,第二行是 n 个用空格分隔的整数;输出该个数。
解答
import sys

def main():
    data = sys.stdin.read().split()
    n = int(data[0])
    nums = list(map(int, data[1:1 + n]))
    odd = sum(x % 2 for x in nums)
    even = n - odd
    print(odd * (odd - 1) // 2 + even * (even - 1) // 2)

main()
解析
当且仅当两个加数奇偶性相同时其和为偶数,因此答案为 C(evens, 2) + C(odds, 2);统计奇偶性的复杂度为 O(n)。LiveCodeBench 用隐藏单元测试运行模型的程序并以 pass@1 评分——只有全部测试通过才算正确。
0 23 46 69 92 2024-07-15 2025-07-10 2026-07-06 Qwen2-72B-Instruct · 35.7 · 2024-07-15 Qwen2-72B-Instruct · 35.7 · 2024-07-15 QwQ-32B-Preview · 50 · 2024-11-28 DeepSeek-R1-Distill-Qwen-32B · 57.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 47.3 · 2025-01-22 Grok 3 (Think) · 79.4 · 2025-02-19 Grok 3 mini · 80.4 · 2025-02-19 Grok 3 · 79.4 · 2025-03-11 DeepSeek-V3-0324 · 49.2 · 2025-03-24 Gemini 2.5 Pro · 70.4 · 2025-03-26 Gemini 2.0 Flash · 34.5 · 2025-04-15 Qwen3-235B-A22B · 70.7 · 2025-05-14 Deepseek-R1-0528 · 73.3 · 2025-05-30 Kimi K2 · 53.7 · 2025-07-28 Kimi K2 · 53.7 · 2025-07-28 GLM-4.6 · 82.8 · 2025-09-30 Kimi K2 Thinking · 83.1 · 2025-11-07 Step 3.5 Flash · 86.4 · 2026-02-10 Grok 4 · 81.9 · 2026-02-25 Agents-A1 · 44.3 · 2026-07-06
Qwen2-72B-Instruct QwQ-32B-Preview DeepSeek-R1-Distill-Qwen-32B Kimi k1.5 (short-CoT) Grok 3 (Think) Grok 3 mini Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro Gemini 2.0 Flash Qwen3-235B-A22B Deepseek-R1-0528 Kimi K2 GLM-4.6 Kimi K2 Thinking Step 3.5 Flash Grok 4 Agents-A1
时间线
日期 模型 得分 来源
2026-07-06 Agents-A1 44.3pts 扩展视界而非参数量:以35B智能体实现万亿参数级性能
2026-02-25 Grok 4 81.9% xAI 发布 Grok 4 推理模型,在智能体和编码基准测试中表现强劲
2026-02-10 Step 3.5 Flash 86.4% 步骤 3.5 Flash:开源 11B 活跃参数的 MoE 模型达到前沿级代理性能
2025-11-07 Kimi K2 Thinking 83.1% Moonshot AI 发布 Kimi K2 Thinking,一款拥有 1T 参数的开源推理模型
2025-09-30 GLM-4.6 82.8% 智谱AI发布具备智能体能力和128k上下文窗口的GLM-4.6
2025-07-28 Kimi K2 53.7% Kimi K2:拥有1T参数和MuonClip优化器的开源MoE模型
2025-07-28 Kimi K2 53.7% Moonshot发布Kimi K2,一款拥有32B激活参数的开放智能体MoE模型
2025-05-30 Deepseek-R1-0528 73.3% DeepSeek更新R1模型,提升推理能力与基准测试成绩
2025-05-14 Qwen3-235B-A22B 70.7% Qwen3 引入统一思维模式并支持 119 种语言
2025-04-15 Gemini 2.0 Flash 34.5% Google 发布 Gemini 2.0 Flash,质量提升且速度是 Gemini 1.5 Pro 的两倍
2025-03-26 Gemini 2.5 Pro 70.4% Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文
2025-03-24 DeepSeek-V3-0324 49.2% DeepSeek-V3-0324 在推理、编码和中文写作方面优于 DeepSeek-V3
2025-03-11 Grok 3 79.4% xAI发布具有深度推理和百万token上下文的Grok 3
2025-02-19 Grok 3 (Think) 79.4% xAI发布Grok 3 Beta版和DeepSearch智能体
2025-02-19 Grok 3 mini 80.4% xAI发布Grok 3 Beta版和DeepSearch智能体
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 57.2% DeepSeek 通过强化学习发布 R1 推理模型
2025-01-22 Kimi k1.5 (short-CoT) 47.3% Kimi k1.5 利用大语言模型扩展强化学习,性能匹敌 o1 并超越短链式思考模型
2024-11-28 QwQ-32B-Preview 50.0% Qwen发布QwQ-32B-Preview,一款实验性推理模型
2024-07-15 Qwen2-72B-Instruct 35.7% Qwen团队发布Qwen2系列,包含72B密集模型和MoE模型
2024-07-15 Qwen2-72B-Instruct 35.7% Qwen2 技术报告介绍高达 72B 的密集和 MoE 模型