Benchmark · agentic

Terminal-Bench

27 条结果 17 个模型

Terminal-Bench 衡量 AI 智能体在终端中完成真实命令行任务的能力,例如安装软件、调试和系统操作。分数是智能体成功完成任务的百分比。

了解更多
示例
一个典型任务会给智能体一个损坏或空白的环境,要求它达到可运行状态——例如安装正确的依赖并修复配置以让程序运行,全部通过终端命令完成。
评分方式
每个任务根据智能体是否达到所需的最终状态判定为通过或失败,基准分数是已解决任务占总数的百分比。
验证方式
只有当隔离沙盒(sandbox)环境中的自动检查确认任务达到了预期结果时,结果才被接受——而不是靠人工投票或精确文本匹配。
为何重要
从命令行安装、调试和运维系统等终端技能是真实工程工作的核心,因此这个基准能显示智能体能否在真正的命令行中自主且可靠地行动,而不只是回答问题。它更难的 2.x 版本会随着智能体进步不断提高门槛。
示例解析
任务
在 Terminal-Bench 的 Docker 容器中,文件 /app/access.log 保存着 Apache 访问日志。请写出一条命令,统计不同客户端 IP 地址的数量(每行以空白分隔的第一个字段),并只将该数字保存到 /app/answer.txt。
解答
awk '{print $1}' /app/access.log | sort -u | wc -l > /app/answer.txt
解析
awk 打印每行日志的第一个字段(客户端 IP),sort -u 去除重复,wc -l 统计剩下的唯一 IP,结果重定向到 /app/answer.txt。Terminal-Bench 通过在容器中运行 pytest 测试来评分,该测试读取 /app/answer.txt 并检查它是否等于已知的唯一 IP 数量。
0 24.5 49 73.5 98 2025-05-22 2025-12-24 2026-07-29 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-23 Claude Sonnet 4 · 35.5 · 2025-05-23 GLM-4.6 · 40.5 · 2025-09-30 Claude Sonnet 4.5 · 50 · 2025-09-30 Claude Opus 4.5 · 59.3 · 2025-11-25 Claude Opus 4.6 · 65.4 · 2026-02-05 Composer 2 · 61.7 · 2026-03-27 GPT-5.6 Sol (ultra mode) · 91.9 · 2026-06-26 GPT-5.6 Sol · 88.8 · 2026-06-26 GLM-5.2 (753B MoE) · 70.8 · 2026-07-08 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 Kimi K2.6 · 73 · 2026-07-29 GPT-5.5 · 69 · 2026-07-29 Kimi K3 · 32 · 2026-07-29
Claude Opus 4 Claude Sonnet 4 GLM-4.6 Claude Sonnet 4.5 Claude Opus 4.5 Claude Opus 4.6 Composer 2 GPT-5.6 Sol (ultra mode) GPT-5.6 Sol GLM-5.2 (753B MoE) RELAI-VCL Meta Harness GEPA baseline agent Kimi K2.6 GPT-5.5 Kimi K3
时间线
日期 模型 得分 来源
2026-07-29 Kimi K2.6 73.0% Fireworks AI 发布 Fireworks Nexus 路由层以控制成本
2026-07-29 GPT-5.5 69.0% Fireworks AI 发布 Fireworks Nexus 路由层以控制成本
2026-07-29 Kimi K3 32.0% Fireworks AI 发布 Fireworks Nexus 路由层以控制成本
2026-07-16 baseline agent 58.7% RELAI-VCL 在 Terminal-Bench 2.0 上的优化增益显现
2026-07-16 Meta Harness 64.6% RELAI-VCL 在 Terminal-Bench 2.0 上的优化增益显现
2026-07-16 GEPA 66.0% RELAI-VCL 在 Terminal-Bench 2.0 上的优化增益显现
2026-07-16 RELAI-VCL 76.4% RELAI-VCL 在 Terminal-Bench 2.0 上的优化增益显现
2026-07-16 Meta Harness 64.6% RELAI-VCL 通过持续学习使代理-优化器收益复合
2026-07-16 RELAI-VCL 76.4% RELAI-VCL 通过持续学习使代理-优化器收益复合
2026-07-16 GEPA 66.0% RELAI-VCL 通过持续学习使代理-优化器收益复合
2026-07-16 baseline agent 58.7% RELAI-VCL 通过持续学习使代理-优化器收益复合
2026-07-16 RELAI-VCL 76.4% RELAI-VCL 通过持续学习使智能体-优化器增益复合
2026-07-16 Meta Harness 64.6% RELAI-VCL 通过持续学习使智能体-优化器增益复合
2026-07-16 GEPA 66.0% RELAI-VCL 通过持续学习使智能体-优化器增益复合
2026-07-16 baseline agent 58.7% RELAI-VCL 通过持续学习使智能体-优化器增益复合
2026-07-08 GLM-5.2 (753B MoE) 70.8% GLM-5.2 在 4× DGX Spark 上以 4-bit 格式在 Terminal-Bench 2.1 中达到 70.8%
2026-06-26 GPT-5.6 Sol (ultra mode) 91.9% OpenAI 低调发布 GPT-5.6 Sol,创下编程记录但承认存在作弊问题
2026-06-26 GPT-5.6 Sol 88.8% OpenAI 低调发布 GPT-5.6 Sol,创下编程记录但承认存在作弊问题
2026-03-27 Composer 2 61.7pts Cursor 发布关于代理式编码模型 Composer 2 训练的技术报告
2026-02-05 Claude Opus 4.6 65.4% Anthropic 发布 Claude Opus 4.6,具备 1M 上下文窗口和智能体改进
2025-11-25 Claude Opus 4.5 59.3% Anthropic发布Claude Opus 4.5,具备最先进的编码和计算机使用能力
2025-09-30 GLM-4.6 40.5% 智谱AI发布具备智能体能力和128k上下文窗口的GLM-4.6
2025-09-30 Claude Sonnet 4.5 50.0% Anthropic 发布 Claude Sonnet 4.5,增强编码与智能体能力
2025-05-23 Claude Sonnet 4 35.5% Anthropic发布Claude Opus 4和Sonnet 4,引入混合推理能力
2025-05-23 Claude Opus 4 43.2% Anthropic发布Claude Opus 4和Sonnet 4,引入混合推理能力
2025-05-22 Claude Opus 4 43.2% Anthropic 推出支持扩展思考与工具使用的 Claude Opus 4 和 Sonnet 4
2025-05-22 Claude Opus 4 43.2% Anthropic发布Claude Opus 4和Sonnet 4,配备ASL-3安全措施