Benchmark · agentic

Terminal-Bench 2

40 条结果 31 个模型

Harbor/Terminus-2 89-task terminal-agent suite; 2.0 and 2.1 are the same task set, so one series. File here only when the quote says 2.0 / 2.1 / v2 — not the original suite (terminal-bench), and not the harder 'Terminal-Bench Hard' subset (not in this catalog).

0 25 50 75 100 2025-11-19 2026-04-15 2026-09-10 GPT-5.1-Codex-Max · 58.1 · 2025-11-19 Step 3.5 Flash · 51 · 2026-02-10 MiniMax M2.7 · 57 · 2026-04-12 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-25 Qwen3.6-27B · 59.3 · 2026-04-25 Qwen3.6-27B · 60.7 · 2026-08-10 GLM 5.2 FP8 with FP8 KV · 79.8 · 2026-07-05 LLM-as-a-Verifier · 86.5 · 2026-07-07 Grok 4.5 · 83.3 · 2026-07-08 hermes · 55 · 2026-07-08 Gemini 3.5 Flash-Lite · 54 · 2026-07-21 Gemini 3.5 Flash-Lite · 54 · 2026-07-21 Gemini 3.5 Flash-Lite · 54 · 2026-07-27 KAT-Coder-V2.5 · 60.7 · 2026-07-26 DeepSeek-V4-Flash · 82.7 · 2026-07-31 DeepSeek-V4-Flash · 79 · 2026-08-01 DeepSeek-V4-Flash-0731 · 82.7 · 2026-07-31 DeepSeek-V4-Flash-0731 · 82.7 · 2026-08-07 V4 Flash 0731 · 79 · 2026-08-01 Inkling-Small · 64.7 · 2026-08-03 Qwen3.8-Max · 86.6 · 2026-08-03 Qwen3.8-Max · 67.4 · 2026-08-05 Muse Spark 1.1 · 80 · 2026-08-05 Pokee-Isaac 28B · 65.1 · 2026-08-08 DeepSeek V4 Flash 0731 · 82.7 · 2026-08-09 Opus 5 · 86.7 · 2026-08-11 Grok 4.6 · 88.4 · 2026-08-13 Grok 4.6 · 88.4 · 2026-08-21 DeepSeek-V4-Pro · 87.9 · 2026-08-13 Ornith-1.5 · 86.1 · 2026-08-19 agents · 94 · 2026-08-20 DeepSeek-V4-Flash-Vision-Exp · 83.9 · 2026-08-21 Granite 4.2 30B · 29.2 · 2026-08-26 Granite 4.2 8B · 20.6 · 2026-08-26 Muse Spark 1.3 · 88.8 · 2026-09-04 K2-Horizon-MoVA-36B-A4B · 58.6 · 2026-09-07 K2-Horizon-375B-A23B · 66.9 · 2026-09-07 DeepSeek-V4.1-Flash · 90.6 · 2026-09-10
GPT-5.1-Codex-Max Step 3.5 Flash MiniMax M2.7 GPT-5.5 Qwen3.6-27B GLM 5.2 FP8 with FP8 KV LLM-as-a-Verifier Grok 4.5 hermes Gemini 3.5 Flash-Lite KAT-Coder-V2.5 DeepSeek-V4-Flash DeepSeek-V4-Flash-0731 V4 Flash 0731 Inkling-Small Qwen3.8-Max Muse Spark 1.1 Pokee-Isaac 28B DeepSeek V4 Flash 0731 Opus 5 Grok 4.6 DeepSeek-V4-Pro Ornith-1.5 agents DeepSeek-V4-Flash-Vision-Exp Granite 4.2 30B Granite 4.2 8B Muse Spark 1.3 K2-Horizon-MoVA-36B-A4B K2-Horizon-375B-A23B DeepSeek-V4.1-Flash
时间线
日期 模型 得分 来源
2026-09-10 DeepSeek-V4.1-Flash 90.6% DeepSeek发布具有原生多模态支持的V4.1-Flash模型
2026-09-07 K2-Horizon-MoVA-36B-A4B 58.6% IFM发布K2 Horizon:六款Apache 2.0许可证模型,参数量从0.9B到375B
2026-09-07 K2-Horizon-375B-A23B 66.9% IFM发布K2 Horizon:六款Apache 2.0许可证模型,参数量从0.9B到375B
2026-09-04 Muse Spark 1.3 88.8% Meta 发布 Muse Spark 1.3,减少工具调用和 token 数量
2026-08-26 Granite 4.2 30B 29.24% IBM发布Granite 4.2,面向开放企业模型提供原生推理与代理式强化学习
2026-08-26 Granite 4.2 8B 20.56% IBM发布Granite 4.2,面向开放企业模型提供原生推理与代理式强化学习
2026-08-21 Grok 4.6 88.4% SpaceXAI 推出 Grok 4.6,提供 Cursor 数据以支持智能体工作
2026-08-21 DeepSeek-V4-Flash-Vision-Exp 83.9% DeepSeek 发布 DeepSeek-V4-Flash-Vision-Exp 多模态模型
2026-08-20 agents 94.0% Meta发布原生音频支持的Muse Video;Stripe收购OpenRouter
2026-08-19 Ornith-1.5 86.1% Ornith-1.5 发布具有自我改进训练功能的 9B、35B-A3B 和 397B 模型
2026-08-13 DeepSeek-V4-Pro 87.9% DeepSeek-V4-Pro GA 发布增强代理能力并添加 Responses API 支持
2026-08-13 Grok 4.6 88.4% xAI发布Grok 4.6;阿里巴巴开源Qwen3.8-MoE;DeepSeek V4 Pro正式商用
2026-08-11 Opus 5 86.74% Ouroboros 自开发智能体使用 Opus 5 创下新基准记录
2026-08-10 Qwen3.6-27B 60.7% Meta发布Muse Glimmer:一款在单张消费级GPU上运行的30B开源权重智能体模型
2026-08-09 DeepSeek V4 Flash 0731 82.7% DeepSeek V4 Flash 0731 在公开基准测试中于 Terminal-Bench 2.1 达到 82.7%
2026-08-08 Pokee-Isaac 28B 65.1% Pokee AI 发布 Pokee-Isaac 28B,一款面向边界内部署的 10M token 上下文模型
2026-08-07 DeepSeek-V4-Flash-0731 82.7% DeepSeek 发布 V4-Flash-0731,以更低成本超越 V4-Pro
2026-08-05 Muse Spark 1.1 80.0% Meta发布由Muse Spark 1.2驱动的Muse Code beta版终端代理
2026-08-05 Qwen3.8-Max 67.4% 阿里巴巴发布Qwen3.8-Max,拥有2.4T参数并即将开放权重
2026-08-03 Qwen3.8-Max 86.6% 阿里巴巴发布Qwen3.8-Max,一款拥有2.4万亿参数的MoE模型
2026-08-03 Inkling-Small 64.7% Thinking Machines Lab 发布 Inkling-Small,一款拥有 276B 开放权重的多模态 MoE 模型
2026-08-01 V4 Flash 0731 79.0% DeepSeek发布V4-Flash,带来重大训练后提升并开放权重
2026-08-01 DeepSeek-V4-Flash 79.0% DeepSeek发布V4-Flash,带来训练后增益与开源权重
2026-07-31 DeepSeek-V4-Flash-0731 82.7% DeepSeek 发布 V4-Flash-0731,以更低的成本实现显著的智能体能力提升
2026-07-31 DeepSeek-V4-Flash 82.7% DeepSeek 发布 DeepSeek-V4-Flash 公测版,增强智能体能力
2026-07-27 Gemini 3.5 Flash-Lite 54.0% Google发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber
2026-07-26 KAT-Coder-V2.5 60.7% 快手KAT发布KAT-Coder-V2.5,一种在10万多个可验证环境中训练的代理编程模型
2026-07-21 Gemini 3.5 Flash-Lite 54.0% Google发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber,面向智能体工作负载
2026-07-21 Gemini 3.5 Flash-Lite 54.0% Google发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber
2026-07-08 hermes 55.0% 用户将 Mimo v2.5 与 DeepSeek V4 Flash 和 Hermes 进行基准测试对比
2026-07-08 Grok 4.5 83.3% xAI发布Grok 4.5,成本低且基准测试表现参差不齐
2026-07-07 LLM-as-a-Verifier 86.5% LLM-as-a-Verifier 引入具有连续评分的通用验证框架
2026-07-05 GLM 5.2 FP8 with FP8 KV 79.8% GLM 5.2 FP8 配合 FP8 KV 在 Terminal-Bench 2.1 上达到 79.8%
2026-04-25 Qwen3.6-27B 59.3% 阿里巴巴发布Qwen3.6-27B,在编程基准测试中超越更大的前代模型
2026-04-25 GPT-5.5 82.7% OpenAI发布GPT-5.5,一款从头重新训练、原生支持全模态处理的模型
2026-04-23 GPT-5.5 82.7% OpenAI发布具备智能体能力的GPT-5.5,API定价翻倍
2026-04-23 GPT-5.5 82.7% OpenAI 通过 API 发布 GPT-5.5 和 GPT-5.5 Pro
2026-04-12 MiniMax M2.7 57.0% MiniMax开源M2.7,一款在SWE-Pro上得分56.22%的自进化MoE模型
2026-02-10 Step 3.5 Flash 51.0% 步骤 3.5 Flash:开源 11B 活跃参数的 MoE 模型达到前沿级代理性能
2025-11-19 GPT-5.1-Codex-Max 58.1% OpenAI 将 GPT-5.1-Codex-Max 设为 Codex CLI 的默认模型