Benchmark · agentic

τ²-bench

17 条结果 13 个模型

τ²-bench 是 τ-bench 的更新版本,用于在「双控制」(dual-control)任务上评测使用工具的对话式 AI 智能体;在这类任务中,智能体和被模拟的用户都可以采取行动来完成工作。核心指标是任务解决的百分比(各任务的平均奖励)。

了解更多
示例
一个技术支持场景:智能体查询客户账户并遵循该领域的策略,同时引导被模拟的用户在其自己的设备上执行操作(例如更改某项设置),双方必须协同配合才能解决问题。
评分方式
每个任务结束时都会自动检查系统/数据库的最终状态是否与要求的结果一致,从而为该任务给出奖励;最终报告的分数是任务解决的百分比(或平均奖励)。
验证方式
验收完全由程序自动完成——环境将最终状态(以及必需的操作)与预期结果进行比对,无需人工评分,因此只有当结果匹配时任务才算完成。
为何重要
它之所以重要,是因为真实助手往往无法独自完成任务——它们必须指导用户并与之协作——而这种双控制设置能暴露出单一执行者的工具基准所忽略的沟通与协作缺陷。
示例解析
任务
τ²-bench,电信(dual-control 双控)领域:模拟用户写道:「从今天早上开始我的移动数据用不了了,但通话和短信还正常。」在给定运营商政策文档和工具,以及用户可在自己手机上执行的设备操作的情况下,验证客户身份、诊断故障并恢复移动数据。
解答
Correct agent trajectory (telecom tools + user-side device actions): 1. get_customer_by_phone(number); confirm identity via name + DOB. 2. get_line_status(line_id) → "active"; get_network_status(region) → "operational" (rules out account suspension and network outage). 3. Follow the "data down / voice up" branch: user confirms Airplane Mode is OFF, then agent instructs the user to switch "Mobile Data" ON. 4. Verify data is restored; apply NO billing credit (policy forbids a fee/credit for a self-service fix). Resolution → user enables Mobile Data; connectivity restored, account state unchanged.
解析
在线路处于 active 且无网络故障时,语音和短信正常而数据中断,说明故障出在设备端,因此政策的排障决策树通过引导用户重新开启 Mobile Data 来解决(并禁止为用户自助修复给予任何补偿)。τ²-bench 为每个任务给出 0/1 的奖励:检查环境/数据库是否达到预期的最终状态,以及所有必需操作和应传达的信息是否齐全,然后用 pass^k 指标报告在重复试验中的可靠性。
0 25 50 75 100 2024-10-22 2025-09-14 2026-08-08 Claude 3.5 Sonnet · 69.2 · 2024-10-22 Claude 3.7 Sonnet · 81.2 · 2025-02-24 Kimi K2 · 66.1 · 2025-07-28 Kimi K2 · 66.1 · 2025-07-28 GLM-4.5 · 90.6 · 2025-08-06 GPT-5 · 63.5 · 2025-08-07 GPT‑5 · 96.7 · 2025-08-07 Kimi K2 Thinking · 93 · 2025-11-07 Kimi K2 Thinking · 93 · 2025-11-19 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 Claude Opus 4.6 · 91.9 · 2026-02-05 Step 3.5 Flash · 88.2 · 2026-02-10 GPT-5.5 · 98 · 2026-04-25 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) · 41.7 · 2026-07-28 Pokee-Isaac 28B · 66.2 · 2026-08-08
Claude 3.5 Sonnet Claude 3.7 Sonnet Kimi K2 GLM-4.5 GPT-5 GPT‑5 Kimi K2 Thinking GPT-5.2 Thinking Claude Opus 4.6 Step 3.5 Flash GPT-5.5 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) Pokee-Isaac 28B
时间线
日期 模型 得分 来源
2026-08-08 Pokee-Isaac 28B 66.2% Pokee AI 发布 Pokee-Isaac 28B,一款面向边界内部署的 10M token 上下文模型
2026-07-28 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) 41.69% AgentOmnia 在全场景应用中扩展智能体模型
2026-04-25 GPT-5.5 98.0% OpenAI发布GPT-5.5,一款从头重新训练、原生支持全模态处理的模型
2026-02-10 Step 3.5 Flash 88.2% 步骤 3.5 Flash:开源 11B 活跃参数的 MoE 模型达到前沿级代理性能
2026-02-05 Claude Opus 4.6 91.9% Anthropic 发布 Claude Opus 4.6,具备 1M 上下文窗口和智能体改进
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI 推出 GPT-5.2,具备改进的代码编写、长上下文和推理能力
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI发布GPT-5.2,在编码和推理基准测试中超越Gemini 3
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI 推出 GPT-5.2,具备最先进的专业知识工作能力
2025-11-19 Kimi K2 Thinking 93.0% Moonshot AI 发布 Kimi K2 Thinking,支持智能体工具调用
2025-11-07 Kimi K2 Thinking 93.0% Moonshot AI 发布 Kimi K2 Thinking,一款拥有 1T 参数的开源推理模型
2025-08-07 GPT-5 63.5% OpenAI 推出统一版 GPT-5,支持实时路由并提供免费访问
2025-08-07 GPT‑5 96.7% OpenAI发布GPT-5 API,增强编码与智能体能力
2025-08-06 GLM-4.5 90.6% 智谱AI发布与Claude和DeepSeek匹敌的GLM-4.5模型
2025-07-28 Kimi K2 66.1% Moonshot发布Kimi K2,一款拥有32B激活参数的开放智能体MoE模型
2025-07-28 Kimi K2 66.1% Kimi K2:拥有1T参数和MuonClip优化器的开源MoE模型
2025-02-24 Claude 3.7 Sonnet 81.2% Anthropic 发布 Claude 3.7 Sonnet,支持动态推理控制
2024-10-22 Claude 3.5 Sonnet 69.2% Anthropic升级Claude 3.5 Sonnet,发布Claude 3.5 Haiku及计算机使用功能公测版