Benchmark · agentic

τ-bench

0 resultados 0 modelos

τ-bench mide qué tan bien un agente de IA gestiona una conversación de atención al cliente de varios turnos mientras llama a herramientas y API para cumplir la petición de un usuario. La puntuación es el porcentaje de tareas que el agente completa correctamente.

Leer más
Ejemplo
Una tarea en el ámbito del comercio minorista o de aerolíneas: por ejemplo, un usuario pide al agente cancelar o cambiar un pedido, y el agente debe preguntar los datos necesarios y luego llamar a las API de backend correctas respetando las reglas y políticas del dominio.
Puntuación
La métrica es la proporción de tareas resueltas correctamente; una tarea cuenta como resuelta cuando el estado final de la base de datos o del entorno coincide con el resultado esperado. Suele reportarse como tasa de éxito (pass@1), con una variante pass^k que mide la consistencia en ejecuciones repetidas.
Verificación
La verificación es automática y no la juzga una persona: tras la conversación, el benchmark compara el estado resultante del sistema (y la información dada al usuario) con un resultado esperado predefinido, de modo que solo una coincidencia objetiva cuenta como acierto.
Por qué importa
Refleja un caso de uso realista y comercialmente importante —agentes que deben conversar y a la vez actuar mediante herramientas bajo reglas de negocio— y revela brechas de fiabilidad, ya que los modelos que aciertan una vez a menudo fallan al reintentar la misma tarea.
Ejemplo resuelto
Tarea
En el dominio retail de τ-bench, un usuario simulado le dice al agente: «Hola, quiero cancelar el pedido #W2611340, lo pedí por error». Siguiendo la política de la tienda (solo se pueden cancelar pedidos aún en estado 'pending' y el motivo debe ser un valor permitido), el agente debe autenticar al usuario, verificar el pedido, confirmarlo con el usuario y cancelarlo mediante llamadas a herramientas.
Solución
# 1) Authenticate the user (policy: verify identity before any action)
find_user_id_by_email(email="mia.li.3818@example.com")
# 2) Look up the order and confirm status == "pending"
get_order_details(order_id="#W2611340")
# 3) After the user confirms, cancel with an allowed reason enum
cancel_pending_order(order_id="#W2611340", reason="ordered by mistake")
Explicación
La política solo permite cancelar un pedido en estado 'pending' y restringe el motivo a dos valores enum ('no longer needed' / 'ordered by mistake'), por lo que el agente primero autentica, comprueba el estado, obtiene la confirmación del usuario y luego hace la llamada de escritura. τ-bench evalúa comparando el estado final de la base de datos con el estado objetivo anotado (el pedido ahora 'cancelled') e informa la fiabilidad pass^k en ensayos repetidos.

Aún no hay puntuaciones verificadas para este benchmark.