| 2026-09-29 |
Gemini 3.5 Flash |
79.0% |
Google Research发布RRSI以防止AI智能体工具链过拟合
|
| 2026-09-29 |
Qwen3.8-Flash-Next Coder |
75.6% |
ISTA发布Qwen3.8-Flash-Next的GSQ-RCO GGUF及50%专家剪枝的Coder构建
|
| 2026-09-29 |
Qwen3.5-4B (with ROFT) |
49.2% |
ROFT 通过在自生成解释上进行微调来改进智能体模型
|
| 2026-09-28 |
Ember-1 |
92.2% |
Fireworks AI 发布 Ember-1:基于 Kimi K3 后训练,使用少 40% 的 token
|
| 2026-09-09 |
Qwen Test agent + Repair agent (post-trained) |
72.6% |
ExecCritic利用角色特定的强化学习,通过测试引导修复提升编码智能体性能
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic利用角色特定的强化学习,通过测试引导修复提升编码智能体性能
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic利用角色特定的强化学习,通过测试引导修复提升编码智能体性能
|
| 2026-09-09 |
base Test agent (no-test baseline) |
57.3% |
ExecCritic利用角色特定的强化学习,通过测试引导修复提升编码智能体性能
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic利用角色特定的强化学习,通过测试引导修复提升编码智能体性能
|
| 2026-09-09 |
Qwen Test agent (post-trained) + Repair agent (post-trained) |
72.6% |
ExecCritic利用角色特定的强化学习,通过测试引导修复提升编码智能体性能
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic利用角色特定的强化学习,通过测试引导修复提升编码智能体性能
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic利用角色特定的强化学习,通过测试引导修复提升编码智能体性能
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic利用角色特定的强化学习,通过测试引导修复提升编码智能体性能
|
| 2026-09-09 |
base Test agent |
57.3% |
ExecCritic利用角色特定的强化学习,通过测试引导修复提升编码智能体性能
|
| 2026-09-07 |
K2-Horizon-7B |
70.6% |
IFM发布K2 Horizon:六款Apache 2.0许可证模型,参数量从0.9B到375B
|
| 2026-09-07 |
K2-Horizon-3.7B |
68.6% |
IFM发布K2 Horizon:六款Apache 2.0许可证模型,参数量从0.9B到375B
|
| 2026-09-02 |
Qwen3.5-9B |
16.6% |
CANOPY 使 Qwen3-14B 在 AppWorld 上登顶,采用仅基于结果的强化学习
|
| 2026-08-26 |
Granite 4.2 30B |
57.0% |
IBM发布Granite 4.2,面向开放企业模型提供原生推理与代理式强化学习
|
| 2026-08-26 |
Granite 4.2 8B |
47.67% |
IBM发布Granite 4.2,面向开放企业模型提供原生推理与代理式强化学习
|
| 2026-08-20 |
Qwen3.5-9B |
14.6% |
Meta发布原生音频支持的Muse Video;Stripe收购OpenRouter
|
| 2026-08-20 |
Ornith-1.5 |
86.0% |
Z.ai提出后训练缩放定律并发布GLM 5.3;Ornith-1.5以自我改进能力上线
|
| 2026-08-19 |
Ornith-1.5 |
86.0% |
Ornith-1.5 发布具有自我改进训练功能的 9B、35B-A3B 和 397B 模型
|
| 2026-08-18 |
Qwen3.5-27B |
74.8% |
Kozuchi Agent 使用 Qwen3.5-27B 解决了 374 个 SWE-bench Verified 实例
|
| 2026-08-10 |
Qwen3.6-27B |
77.2% |
Meta发布Muse Glimmer:一款在单张消费级GPU上运行的30B开源权重智能体模型
|
| 2026-08-03 |
Orchard-SWE |
69.7% |
微软研究院发布用于可扩展智能体AI的Orchard框架
|
| 2026-08-03 |
Inkling-Small |
80.2% |
Thinking Machines Lab 发布 Inkling-Small,一款拥有 276B 开放权重的多模态 MoE 模型
|
| 2026-07-24 |
Claude Opus 5 |
96.0% |
Anthropic发布Claude Opus 5,默认启用思考功能并提升智能体编码能力
|
| 2026-07-19 |
DeepSeek V4 Pro |
80.6% |
Kimi K3、DeepSeek V4 Pro 和 GLM-5.2 在基准测试、许可证和服务成本方面的对比
|
| 2026-07-17 |
Devstral 2 |
72.2% |
Mistral Vibe for Code 在脚手架到PR任务中领先四大编码代理
|
| 2026-07-17 |
Devstral Small 2 |
68.0% |
Mistral Vibe for Code 在脚手架到PR任务中领先四大编码代理
|
| 2026-07-14 |
Qwen3.5-35B-A3B |
6.0% |
UMoE重新对齐MoE专家池以改进特定领域的微调
|
| 2026-07-14 |
Qwen3-30B-A3B |
6.0% |
UMoE重新对齐MoE专家池以改进特定领域的微调
|
| 2026-07-07 |
LLM-as-a-Verifier |
78.2% |
LLM-as-a-Verifier 引入具有连续评分的通用验证框架
|
| 2026-04-25 |
Qwen3.6-27B |
77.2% |
阿里巴巴发布Qwen3.6-27B,在编程基准测试中超越更大的前代模型
|
| 2026-04-24 |
V4-Pro-Max |
80.6% |
DeepSeek 发布 V4,采用面向智能体的高效长上下文架构
|
| 2026-03-25 |
o3 |
71.7% |
OpenAI 宣布从 ChatGPT 中退役 o3 并分享基准测试分数
|
| 2026-02-17 |
Claude Sonnet 4.6 |
79.6% |
Anthropic发布Claude Sonnet 4.6,提升编码、计算机使用能力及100万token上下文
|
| 2026-02-05 |
Claude Opus 4.6 |
80.8% |
Anthropic 发布 Claude Opus 4.6,具备 1M 上下文窗口和智能体改进
|
| 2026-02-01 |
Claude Opus 4.6 |
80.8% |
去污染基准测试揭示顶级AI编程模型之间存在12分差距
|
| 2026-02-01 |
MiniMax M2.5 |
80.2% |
去污染基准测试揭示顶级AI编程模型之间存在12分差距
|
| 2026-01-28 |
Qwen3.6-27B |
77.2% |
Qwen 3.6-27B 和 DeepSeek V4 Flash 领跑本地编码基准测试
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI发布GPT-5.2,在编码和推理基准测试中超越Gemini 3
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI 推出 GPT-5.2,具备最先进的专业知识工作能力
|
| 2025-12-09 |
Devstral 2 |
72.2% |
Mistral 发布 Devstral 2 编码模型和 Mistral Vibe CLI
|
| 2025-12-09 |
Devstral Small 2 |
68.0% |
Mistral 发布 Devstral 2 编码模型和 Mistral Vibe CLI
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
77.9% |
OpenAI 将 GPT-5.1-Codex-Max 设为 Codex CLI 的默认模型
|
| 2025-11-19 |
Kimi K2 Thinking |
71.3% |
Moonshot AI 发布 Kimi K2 Thinking,支持智能体工具调用
|
| 2025-11-07 |
Kimi K2 Thinking |
71.3% |
Moonshot AI 发布 Kimi K2 Thinking,一款拥有 1T 参数的开源推理模型
|
| 2025-09-30 |
Claude Sonnet 4.5 |
77.2% |
Anthropic 发布 Claude Sonnet 4.5,增强编码与智能体能力
|
| 2025-09-29 |
Claude Sonnet 4.5 |
77.2% |
Anthropic
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI 推出统一版 GPT-5,支持实时路由并提供免费访问
|
| 2025-08-07 |
GPT‑5 |
74.9% |
OpenAI发布GPT-5 API,增强编码与智能体能力
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI 推出 GPT-5,具备统一路由与专家级推理能力
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI 发布具备自适应推理与统一架构的 GPT-5
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI
|
| 2025-08-06 |
GLM-4.5 |
64.2% |
智谱AI发布与Claude和DeepSeek匹敌的GLM-4.5模型
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Moonshot发布Kimi K2,一款拥有32B激活参数的开放智能体MoE模型
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Kimi K2:拥有1T参数和MuonClip优化器的开源MoE模型
|
| 2025-07-11 |
Kimi K2-Instruct |
65.8% |
Moonshot AI 发布 Kimi-K2-Instruct,一款具备智能体能力的 1T 参数 MoE 模型
|
| 2025-07-11 |
Kimi K2 |
65.8% |
Moonshot AI 发布 Kimi K2:具备智能体能力的 1T 参数 MoE 模型
|
| 2025-07-10 |
Devstral Medium |
61.6% |
Mistral AI 与 All Hands AI 联合发布 Devstral Small 1.1 和 Devstral Medium
|
| 2025-07-10 |
Devstral Small 1.1 |
53.6% |
Mistral AI 与 All Hands AI 联合发布 Devstral Small 1.1 和 Devstral Medium
|
| 2025-05-30 |
Deepseek-R1-0528 |
57.6% |
DeepSeek更新R1模型,提升推理能力与基准测试成绩
|
| 2025-05-23 |
Claude Sonnet 4 |
72.7% |
Anthropic发布Claude Opus 4和Sonnet 4,引入混合推理能力
|
| 2025-05-23 |
Claude Opus 4 |
72.5% |
Anthropic发布Claude Opus 4和Sonnet 4,引入混合推理能力
|
| 2025-05-22 |
Claude Opus 4 |
72.5% |
Anthropic
|
| 2025-05-21 |
Devstral |
46.8% |
Mistral AI 发布面向软件工程的 Devstral 智能体大语言模型
|
| 2025-04-17 |
o4-mini |
68.1% |
OpenAI发布o4-mini:一款更快、更便宜的多模态推理模型
|
| 2025-04-16 |
OpenAI o3 |
71.7% |
OpenAI
|
| 2025-04-14 |
GPT-4.1 |
54.6% |
OpenAI发布GPT-4.1系列,支持100万token上下文并改进编码能力
|
| 2025-04-14 |
GPT‑4.1 |
54.6% |
OpenAI在API中推出GPT-4.1、GPT-4.1 mini和GPT-4.1 nano
|
| 2025-03-26 |
Gemini 2.5 Pro |
63.8% |
Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google 推出 Gemini 2.5 Pro 实验模型
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google推出Gemini 2.5 Pro思维模型
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google DeepMind
|
| 2025-03-05 |
GPT-4.5 |
38.0% |
OpenAI发布GPT-4.5,其为ChatGPT Plus推出的最大模型
|
| 2025-02-24 |
Claude 3.7 Sonnet |
62.3% |
Anthropic
|
| 2025-01-06 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet 在 SWE-bench Verified 上达到 49%
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI 发布 o3 模型,在推理和编程方面表现卓越
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI 预览 o3 推理模型,在 ARC AGI 和 Frontier Math 上取得突破
|
| 2024-10-30 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet在SWE-bench Verified上取得49%的成绩,仅需极少的智能体框架
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic升级Claude 3.5 Sonnet,发布Claude 3.5 Haiku及计算机使用功能公测版
|
| 2024-10-22 |
Claude 3.5 Haiku |
40.6% |
Anthropic升级Claude 3.5 Sonnet,发布Claude 3.5 Haiku及计算机使用功能公测版
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic
|
| 2024-08-13 |
Agentless |
32.0% |
OpenAI发布SWE-bench Verified,包含人工验证的子集
|
| 2024-08-13 |
GPT‑4o |
33.2% |
OpenAI发布SWE-bench Verified,包含人工验证的子集
|