Benchmark · agentic

τ²-bench

19 resultados 15 modelos

τ²-bench es una versión actualizada de τ-bench que evalúa a agentes de IA conversacional que usan herramientas en tareas de «control dual» (dual-control), donde tanto el agente como un usuario simulado pueden realizar acciones para completar el trabajo. La métrica principal es el porcentaje de tareas resueltas (la recompensa media entre tareas).

Leer más
Ejemplo
Un escenario de soporte técnico: el agente consulta la cuenta de un cliente y sigue la política del dominio mientras guía a un usuario simulado para que ejecute pasos en su propio dispositivo (por ejemplo, cambiar un ajuste), y ambos deben coordinarse para resolver el problema.
Puntuación
Cada tarea termina con una comprobación automática de si el estado final del sistema/base de datos coincide con el resultado requerido, lo que da una recompensa por tarea; la puntuación reportada es el porcentaje de tareas resueltas (o la recompensa media).
Verificación
La aceptación es totalmente programática: el entorno compara el estado final (y las acciones requeridas) con el resultado esperado, sin calificación humana, de modo que una tarea solo cuenta cuando el resultado coincide.
Por qué importa
Importa porque los asistentes reales a menudo no pueden actuar solos —deben instruir y coordinarse con un usuario— y este esquema de control dual expone fallos de comunicación y coordinación que los benchmarks de un solo actor pasan por alto.
Ejemplo resuelto
Tarea
τ²-bench, dominio de telecomunicaciones (dual-control): un usuario simulado escribe: «Desde esta mañana no tengo datos móviles, pero las llamadas y los SMS sí funcionan». Con el documento de políticas del operador y las herramientas —además de acciones en el dispositivo que el usuario puede realizar en su propio teléfono—, autentica al cliente, diagnostica la falla y restablece los datos móviles.
Solución
Correct agent trajectory (telecom tools + user-side device actions): 1. get_customer_by_phone(number); confirm identity via name + DOB. 2. get_line_status(line_id) → "active"; get_network_status(region) → "operational" (rules out account suspension and network outage). 3. Follow the "data down / voice up" branch: user confirms Airplane Mode is OFF, then agent instructs the user to switch "Mobile Data" ON. 4. Verify data is restored; apply NO billing credit (policy forbids a fee/credit for a self-service fix). Resolution → user enables Mobile Data; connectivity restored, account state unchanged.
Explicación
Como la voz y los SMS funcionan mientras los datos están caídos en una línea activa y sin corte de red, la falla es del dispositivo, así que el árbol de diagnóstico de la política la resuelve guiando al usuario a reactivar Mobile Data (y prohíbe cualquier crédito de cortesía por una solución hecha por el propio usuario). τ²-bench asigna una recompensa por tarea (0/1) comprobando que el entorno/base de datos alcanza el estado final esperado y que están presentes todas las acciones requeridas y la información comunicada, y luego reporta la fiabilidad en ensayos repetidos mediante la métrica pass^k.
0 25 50 75 100 2024-10-22 2025-09-14 2026-08-08 Claude 3.5 Sonnet · 69.2 · 2024-10-22 Claude 3.7 Sonnet · 81.2 · 2025-02-24 Kimi K2 · 66.1 · 2025-07-28 Kimi K2 · 66.1 · 2025-07-28 GLM-4.5 · 90.6 · 2025-08-06 GPT‑5 · 96.7 · 2025-08-07 GPT-5 · 63.5 · 2025-08-07 Kimi K2 Thinking · 93 · 2025-11-07 Kimi K2 Thinking · 93 · 2025-11-19 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 Claude Opus 4.6 · 91.9 · 2026-02-05 Step 3.5 Flash · 88.2 · 2026-02-10 GPT-5.5 · 98 · 2026-04-25 ToolGraph+DPO · 35.5 · 2026-06-27 ToolGraph · 33.8 · 2026-06-27 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) · 41.7 · 2026-07-28 Pokee-Isaac 28B · 66.2 · 2026-08-08
Claude 3.5 Sonnet Claude 3.7 Sonnet Kimi K2 GLM-4.5 GPT‑5 GPT-5 Kimi K2 Thinking GPT-5.2 Thinking Claude Opus 4.6 Step 3.5 Flash GPT-5.5 ToolGraph+DPO ToolGraph AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) Pokee-Isaac 28B
Cronología
Fecha Modelo Puntuación Fuente
2026-08-08 Pokee-Isaac 28B 66.2% Pokee AI lanza Pokee-Isaac 28B, un modelo de contexto de 10M tokens para despliegue en límites definidos
2026-07-28 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) 41.69% AgentOmnia escala modelos agénticos en aplicaciones de escenario completo
2026-06-27 ToolGraph+DPO 35.5% Autoevolución de agentes con capacidad de llamada de herramientas mediante aprendizaje de preferencia en puntos de divergencia
2026-06-27 ToolGraph 33.8% Autoevolución de agentes con capacidad de llamada de herramientas mediante aprendizaje de preferencia en puntos de divergencia
2026-04-25 GPT-5.5 98.0% OpenAI lanza GPT-5.5, un modelo reentrenado desde cero con procesamiento omnimodal nativo
2026-02-10 Step 3.5 Flash 88.2% Paso 3.5 Flash: modelo MoE abierto con 11B activos alcanza rendimiento de agente de nivel fronterizo
2026-02-05 Claude Opus 4.6 91.9% Anthropic lanza Claude Opus 4.6 con ventana de contexto de 1M y mejoras agénticas
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI lanza GPT-5.2, superando a Gemini 3 en benchmarks de codificación y razonamiento
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI presenta GPT-5.2 con capacidades mejoradas de codificación, contexto largo y razonamiento
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI presenta GPT-5.2 con capacidades de vanguardia para el trabajo profesional del conocimiento
2025-11-19 Kimi K2 Thinking 93.0% Moonshot AI lanza Kimi K2 Thinking con uso de herramientas agénticas
2025-11-07 Kimi K2 Thinking 93.0% Moonshot AI lanza Kimi K2 Thinking, un modelo de razonamiento de código abierto con 1T parámetros
2025-08-07 GPT‑5 96.7% OpenAI lanza la API de GPT-5 con mejoras en codificación y agentes
2025-08-07 GPT-5 63.5% OpenAI lanza GPT-5 unificado con enrutamiento en tiempo real y acceso gratuito
2025-08-06 GLM-4.5 90.6% Zhipu AI lanza los modelos GLM-4.5 que igualan a Claude y DeepSeek
2025-07-28 Kimi K2 66.1% Kimi K2: modelo MoE abierto con 1T parámetros y optimizador MuonClip
2025-07-28 Kimi K2 66.1% Moonshot lanza Kimi K2, un modelo MoE agénico abierto con 32B de parámetros activados
2025-02-24 Claude 3.7 Sonnet 81.2% Anthropic lanza Claude 3.7 Sonnet con control dinámico de razonamiento
2024-10-22 Claude 3.5 Sonnet 69.2% Anthropic actualiza Claude 3.5 Sonnet, lanza Claude 3.5 Haiku y la versión beta de uso del ordenador