Benchmark · agentic

SWE-bench Verified

63 条结果 41 个模型

测试 AI 智能体能否端到端地解决真实的 GitHub issue。"Verified" 集是从流行的开源 Python 仓库中挑选的 500 个经人工验证的任务。

了解更多
示例
给定一份缺陷报告和对应仓库,模型必须生成一个代码补丁——例如修复一个出错的日期解析函数,让项目的测试套件通过。
评分方式
已解决 issue 的百分比——通常以 pass@1(一次尝试)报告。越高越好。
验证方式
完全自动:应用生成的补丁,并在沙箱中运行项目真实的隐藏单元测试。只有当所有目标测试都通过且没有任何回归时,任务才算解决。
为何重要
当前最主流的真实世界编码智能体基准,也是每次前沿模型发布中的标志性数字;这里的进展反映了智能体距离自主软件工程还有多远。
示例解析
任务
仓库 django/django,处于某个固定的基础提交。缺陷报告:django.utils.text.slugify("___This-is-a-Test___", allow_unicode=True) 返回 '___this-is-a-test___',但开头和结尾的下划线与连字符应被去除,使结果为 'this-is-a-test'。模型只拿到 issue 文本和该仓库,必须输出一个 unified diff 格式的补丁。
解答
--- a/django/utils/text.py
+++ b/django/utils/text.py
@@ def slugify(value, allow_unicode=False):
     value = re.sub(r"[^\w\s-]", "", value.lower())
-    return re.sub(r"[-\s]+", "-", value)
+    return re.sub(r"[-\s]+", "-", value).strip("-_")
解析
slugify 会合并内部的分隔符,但从不修剪两端的 -/_,因此在最后一个 re.sub 后追加 .strip("-_") 即可去除它们;该补丁改动最小,并保留其余所有行为。SWE-bench Verified 将补丁应用到基础提交处的仓库,并通过运行隐藏测试套件评分——只有当所有 FAIL_TO_PASS 测试都变为通过、同时所有 PASS_TO_PASS 测试保持通过时,才算解决。
0 25 50 75 100 2024-08-13 2025-08-11 2026-08-10 Agentless · 32 · 2024-08-13 GPT‑4o · 33.2 · 2024-08-13 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-30 Claude 3.5 Sonnet · 49 · 2025-01-06 Claude 3.5 Haiku · 40.6 · 2024-10-22 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2026-03-25 GPT-4.5 · 38 · 2025-03-05 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-26 GPT-4.1 · 54.6 · 2025-04-14 GPT‑4.1 · 54.6 · 2025-04-14 o4-mini · 68.1 · 2025-04-17 Devstral · 46.8 · 2025-05-21 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-23 Claude Sonnet 4 · 72.7 · 2025-05-23 Deepseek-R1-0528 · 57.6 · 2025-05-30 Devstral Medium · 61.6 · 2025-07-10 Devstral Small 1.1 · 53.6 · 2025-07-10 Kimi K2-Instruct · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-28 Kimi K2 · 65.8 · 2025-07-28 GLM-4.5 · 64.2 · 2025-08-06 GPT‑5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 Claude Sonnet 4.5 · 77.2 · 2025-09-29 Claude Sonnet 4.5 · 77.2 · 2025-09-30 Kimi K2 Thinking · 71.3 · 2025-11-07 Kimi K2 Thinking · 71.3 · 2025-11-19 GPT-5.1-Codex-Max · 77.9 · 2025-11-19 Devstral 2 · 72.2 · 2025-12-09 Devstral 2 · 72.2 · 2026-07-17 Devstral Small 2 · 68 · 2025-12-09 Devstral Small 2 · 68 · 2026-07-17 GPT-5.2 Thinking · 80 · 2025-12-11 GPT-5.2 Thinking · 80 · 2025-12-11 Qwen3.6-27B · 77.2 · 2026-01-28 Qwen3.6-27B · 77.2 · 2026-04-25 Qwen3.6-27B · 77.2 · 2026-08-10 Claude Opus 4.6 · 80.8 · 2026-02-01 Claude Opus 4.6 · 80.8 · 2026-02-05 MiniMax M2.5 · 80.2 · 2026-02-01 Claude Sonnet 4.6 · 79.6 · 2026-02-17 V4-Pro-Max · 80.6 · 2026-04-24 LLM-as-a-Verifier · 78.2 · 2026-07-07 Qwen3.5-35B-A3B · 6 · 2026-07-14 Qwen3-30B-A3B · 6 · 2026-07-14 DeepSeek V4 Pro · 80.6 · 2026-07-19 Claude Opus 5 · 96 · 2026-07-24 Inkling-Small · 80.2 · 2026-08-03 Orchard-SWE · 69.7 · 2026-08-03 Claude 3.7 Sonnet · 62.3 · 2025-02-24 OpenAI o3 · 71.7 · 2025-04-16
Agentless GPT‑4o Claude 3.5 Sonnet Claude 3.5 Haiku o3 GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 o4-mini Devstral Claude Opus 4 Claude Sonnet 4 Deepseek-R1-0528 Devstral Medium Devstral Small 1.1 Kimi K2-Instruct Kimi K2 GLM-4.5 GPT‑5 GPT-5 Claude Sonnet 4.5 Kimi K2 Thinking GPT-5.1-Codex-Max Devstral 2 Devstral Small 2 GPT-5.2 Thinking Qwen3.6-27B Claude Opus 4.6 MiniMax M2.5 Claude Sonnet 4.6 V4-Pro-Max LLM-as-a-Verifier Qwen3.5-35B-A3B Qwen3-30B-A3B DeepSeek V4 Pro Claude Opus 5 Inkling-Small Orchard-SWE Claude 3.7 Sonnet OpenAI o3
时间线
日期 模型 得分 来源
2026-08-10 Qwen3.6-27B 77.2% Meta发布Muse Glimmer:一款在单张消费级GPU上运行的30B开源权重智能体模型
2026-08-03 Orchard-SWE 69.7% 微软研究院发布用于可扩展智能体AI的Orchard框架
2026-08-03 Inkling-Small 80.2% Thinking Machines Lab 发布 Inkling-Small,一款拥有 276B 开放权重的多模态 MoE 模型
2026-07-24 Claude Opus 5 96.0% Anthropic发布Claude Opus 5,默认启用思考功能并提升智能体编码能力
2026-07-19 DeepSeek V4 Pro 80.6% Kimi K3、DeepSeek V4 Pro 和 GLM-5.2 在基准测试、许可证和服务成本方面的对比
2026-07-17 Devstral Small 2 68.0% Mistral Vibe for Code 在脚手架到PR任务中领先四大编码代理
2026-07-17 Devstral 2 72.2% Mistral Vibe for Code 在脚手架到PR任务中领先四大编码代理
2026-07-14 Qwen3.5-35B-A3B 6.0% UMoE重新对齐MoE专家池以改进特定领域的微调
2026-07-14 Qwen3-30B-A3B 6.0% UMoE重新对齐MoE专家池以改进特定领域的微调
2026-07-07 LLM-as-a-Verifier 78.2% LLM-as-a-Verifier 引入具有连续评分的通用验证框架
2026-04-25 Qwen3.6-27B 77.2% 阿里巴巴发布Qwen3.6-27B,在编程基准测试中超越更大的前代模型
2026-04-24 V4-Pro-Max 80.6% DeepSeek 发布 V4,采用面向智能体的高效长上下文架构
2026-03-25 o3 71.7% OpenAI 宣布从 ChatGPT 中退役 o3 并分享基准测试分数
2026-02-17 Claude Sonnet 4.6 79.6% Anthropic发布Claude Sonnet 4.6,提升编码、计算机使用能力及100万token上下文
2026-02-05 Claude Opus 4.6 80.8% Anthropic 发布 Claude Opus 4.6,具备 1M 上下文窗口和智能体改进
2026-02-01 Claude Opus 4.6 80.8% 去污染基准测试揭示顶级AI编程模型之间存在12分差距
2026-02-01 MiniMax M2.5 80.2% 去污染基准测试揭示顶级AI编程模型之间存在12分差距
2026-01-28 Qwen3.6-27B 77.2% Qwen 3.6-27B 和 DeepSeek V4 Flash 领跑本地编码基准测试
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI 推出 GPT-5.2,具备最先进的专业知识工作能力
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI发布GPT-5.2,在编码和推理基准测试中超越Gemini 3
2025-12-09 Devstral 2 72.2% Mistral 发布 Devstral 2 编码模型和 Mistral Vibe CLI
2025-12-09 Devstral Small 2 68.0% Mistral 发布 Devstral 2 编码模型和 Mistral Vibe CLI
2025-11-19 GPT-5.1-Codex-Max 77.9% OpenAI 将 GPT-5.1-Codex-Max 设为 Codex CLI 的默认模型
2025-11-19 Kimi K2 Thinking 71.3% Moonshot AI 发布 Kimi K2 Thinking,支持智能体工具调用
2025-11-07 Kimi K2 Thinking 71.3% Moonshot AI 发布 Kimi K2 Thinking,一款拥有 1T 参数的开源推理模型
2025-09-30 Claude Sonnet 4.5 77.2% Anthropic 发布 Claude Sonnet 4.5,增强编码与智能体能力
2025-09-29 Claude Sonnet 4.5 77.2% Anthropic
2025-08-07 GPT‑5 74.9% OpenAI发布GPT-5 API,增强编码与智能体能力
2025-08-07 GPT-5 74.9% OpenAI 发布具备自适应推理与统一架构的 GPT-5
2025-08-07 GPT-5 74.9% OpenAI 推出统一版 GPT-5,支持实时路由并提供免费访问
2025-08-07 GPT-5 74.9% OpenAI 推出 GPT-5,具备统一路由与专家级推理能力
2025-08-07 GPT-5 74.9% OpenAI
2025-08-06 GLM-4.5 64.2% 智谱AI发布与Claude和DeepSeek匹敌的GLM-4.5模型
2025-07-28 Kimi K2 65.8% Kimi K2:拥有1T参数和MuonClip优化器的开源MoE模型
2025-07-28 Kimi K2 65.8% Moonshot发布Kimi K2,一款拥有32B激活参数的开放智能体MoE模型
2025-07-11 Kimi K2-Instruct 65.8% Moonshot AI 发布 Kimi-K2-Instruct,一款具备智能体能力的 1T 参数 MoE 模型
2025-07-11 Kimi K2 65.8% Moonshot AI 发布 Kimi K2:具备智能体能力的 1T 参数 MoE 模型
2025-07-10 Devstral Medium 61.6% Mistral AI 与 All Hands AI 联合发布 Devstral Small 1.1 和 Devstral Medium
2025-07-10 Devstral Small 1.1 53.6% Mistral AI 与 All Hands AI 联合发布 Devstral Small 1.1 和 Devstral Medium
2025-05-30 Deepseek-R1-0528 57.6% DeepSeek更新R1模型,提升推理能力与基准测试成绩
2025-05-23 Claude Opus 4 72.5% Anthropic发布Claude Opus 4和Sonnet 4,引入混合推理能力
2025-05-23 Claude Sonnet 4 72.7% Anthropic发布Claude Opus 4和Sonnet 4,引入混合推理能力
2025-05-22 Claude Opus 4 72.5% Anthropic
2025-05-21 Devstral 46.8% Mistral AI 发布面向软件工程的 Devstral 智能体大语言模型
2025-04-17 o4-mini 68.1% OpenAI发布o4-mini:一款更快、更便宜的多模态推理模型
2025-04-16 OpenAI o3 71.7% OpenAI
2025-04-14 GPT-4.1 54.6% OpenAI发布GPT-4.1系列,支持100万token上下文并改进编码能力
2025-04-14 GPT‑4.1 54.6% OpenAI在API中推出GPT-4.1、GPT-4.1 mini和GPT-4.1 nano
2025-03-26 Gemini 2.5 Pro 63.8% Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文
2025-03-25 Gemini 2.5 Pro 63.8% Google推出Gemini 2.5 Pro思维模型
2025-03-25 Gemini 2.5 Pro 63.8% Google 推出 Gemini 2.5 Pro 实验模型
2025-03-25 Gemini 2.5 Pro 63.8% Google DeepMind
2025-03-05 GPT-4.5 38.0% OpenAI发布GPT-4.5,其为ChatGPT Plus推出的最大模型
2025-02-24 Claude 3.7 Sonnet 62.3% Anthropic
2025-01-06 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet 在 SWE-bench Verified 上达到 49%
2024-12-20 o3 71.7% OpenAI 发布 o3 模型,在推理和编程方面表现卓越
2024-12-20 o3 71.7% OpenAI 预览 o3 推理模型,在 ARC AGI 和 Frontier Math 上取得突破
2024-10-30 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet在SWE-bench Verified上取得49%的成绩,仅需极少的智能体框架
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic升级Claude 3.5 Sonnet,发布Claude 3.5 Haiku及计算机使用功能公测版
2024-10-22 Claude 3.5 Haiku 40.6% Anthropic升级Claude 3.5 Sonnet,发布Claude 3.5 Haiku及计算机使用功能公测版
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic
2024-08-13 Agentless 32.0% OpenAI发布SWE-bench Verified,包含人工验证的子集
2024-08-13 GPT‑4o 33.2% OpenAI发布SWE-bench Verified,包含人工验证的子集