Benchmark · agentic

τ²-bench

17 resultados 13 modelos

τ²-bench é uma versão atualizada do τ-bench que avalia agentes de IA conversacional que usam ferramentas em tarefas de «controle duplo» (dual-control), nas quais tanto o agente quanto um usuário simulado podem executar ações para concluir o trabalho. A métrica principal é a porcentagem de tarefas resolvidas (a recompensa média entre as tarefas).

Saiba mais
Exemplo
Um cenário de suporte técnico: o agente consulta a conta de um cliente e segue a política do domínio enquanto orienta um usuário simulado a executar passos no próprio dispositivo (por exemplo, mudar uma configuração), e os dois precisam se coordenar para resolver o problema.
Pontuação
Cada tarefa termina com uma verificação automática de se o estado final do sistema/banco de dados corresponde ao resultado exigido, gerando uma recompensa por tarefa; a pontuação reportada é a porcentagem de tarefas resolvidas (ou a recompensa média).
Verificação
A aceitação é totalmente programática — o ambiente compara o estado final (e as ações exigidas) com o resultado esperado, sem avaliação humana, de modo que uma tarefa só conta quando o resultado corresponde.
Por que importa
Importa porque assistentes reais muitas vezes não podem agir sozinhos — precisam instruir e se coordenar com um usuário — e esse esquema de controle duplo expõe falhas de comunicação e coordenação que benchmarks de um único ator não captam.
Exemplo resolvido
Tarefa
τ²-bench, domínio de telecom (dual-control): um usuário simulado escreve: «Desde esta manhã estou sem dados móveis, mas chamadas e SMS ainda funcionam». Com o documento de políticas da operadora e as ferramentas — além de ações no dispositivo que o usuário pode executar no próprio celular —, autentique o cliente, diagnostique a falha e restaure os dados móveis.
Solução
Correct agent trajectory (telecom tools + user-side device actions): 1. get_customer_by_phone(number); confirm identity via name + DOB. 2. get_line_status(line_id) → "active"; get_network_status(region) → "operational" (rules out account suspension and network outage). 3. Follow the "data down / voice up" branch: user confirms Airplane Mode is OFF, then agent instructs the user to switch "Mobile Data" ON. 4. Verify data is restored; apply NO billing credit (policy forbids a fee/credit for a self-service fix). Resolution → user enables Mobile Data; connectivity restored, account state unchanged.
Explicação
Como voz e SMS funcionam enquanto os dados estão fora numa linha active e sem queda de rede, a falha é do dispositivo, então a árvore de diagnóstico da política a resolve orientando o usuário a reativar o Mobile Data (e proíbe qualquer crédito de cortesia por uma correção feita pelo próprio usuário). O τ²-bench atribui uma recompensa por tarefa (0/1) verificando se o ambiente/banco de dados chega ao estado final esperado e se todas as ações exigidas e as informações comunicadas estão presentes, e então reporta a confiabilidade em tentativas repetidas pela métrica pass^k.
0 25 50 75 100 2024-10-22 2025-09-14 2026-08-08 Claude 3.5 Sonnet · 69.2 · 2024-10-22 Claude 3.7 Sonnet · 81.2 · 2025-02-24 Kimi K2 · 66.1 · 2025-07-28 Kimi K2 · 66.1 · 2025-07-28 GLM-4.5 · 90.6 · 2025-08-06 GPT-5 · 63.5 · 2025-08-07 GPT‑5 · 96.7 · 2025-08-07 Kimi K2 Thinking · 93 · 2025-11-07 Kimi K2 Thinking · 93 · 2025-11-19 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 Claude Opus 4.6 · 91.9 · 2026-02-05 Step 3.5 Flash · 88.2 · 2026-02-10 GPT-5.5 · 98 · 2026-04-25 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) · 41.7 · 2026-07-28 Pokee-Isaac 28B · 66.2 · 2026-08-08
Claude 3.5 Sonnet Claude 3.7 Sonnet Kimi K2 GLM-4.5 GPT-5 GPT‑5 Kimi K2 Thinking GPT-5.2 Thinking Claude Opus 4.6 Step 3.5 Flash GPT-5.5 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) Pokee-Isaac 28B
Linha do tempo
Data Modelo Pontuação Fonte
2026-08-08 Pokee-Isaac 28B 66.2% Pokee AI lança Pokee-Isaac 28B, um modelo de contexto de 10M de tokens para implantação em limites definidos
2026-07-28 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) 41.69% AgentOmnia escala modelos agênticos em aplicações de cenários completos
2026-04-25 GPT-5.5 98.0% OpenAI lança GPT-5.5, um modelo retreinado do zero com processamento omnimodal nativo
2026-02-10 Step 3.5 Flash 88.2% Passo 3.5 Flash: modelo MoE aberto com 11B ativos atinge desempenho de agente de nível fronteira
2026-02-05 Claude Opus 4.6 91.9% Anthropic lança Claude Opus 4.6 com janela de contexto de 1M e melhorias agênticas
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI apresenta GPT-5.2 com capacidades aprimoradas de codificação, contexto longo e raciocínio
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI lança GPT-5.2, superando Gemini 3 em benchmarks de codificação e raciocínio
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI apresenta GPT-5.2 com capacidades de ponta para trabalho profissional do conhecimento
2025-11-19 Kimi K2 Thinking 93.0% Moonshot AI lança Kimi K2 Thinking com uso de ferramentas agênticas
2025-11-07 Kimi K2 Thinking 93.0% Moonshot AI lança Kimi K2 Thinking, um modelo de raciocínio open-source com 1T parâmetros
2025-08-07 GPT-5 63.5% OpenAI lança GPT-5 unificado com roteamento em tempo real e acesso gratuito
2025-08-07 GPT‑5 96.7% OpenAI lança API do GPT-5 com melhorias em codificação e agentes
2025-08-06 GLM-4.5 90.6% Zhipu AI lança modelos GLM-4.5 que igualam Claude e DeepSeek
2025-07-28 Kimi K2 66.1% Moonshot lança Kimi K2, um modelo MoE agêntico aberto com 32B de parâmetros ativados
2025-07-28 Kimi K2 66.1% Kimi K2: modelo MoE aberto com 1T de parâmetros e otimizador MuonClip
2025-02-24 Claude 3.7 Sonnet 81.2% Anthropic lança Claude 3.7 Sonnet com controle dinâmico de raciocínio
2024-10-22 Claude 3.5 Sonnet 69.2% Anthropic atualiza Claude 3.5 Sonnet, lança Claude 3.5 Haiku e versão beta de uso do computador