Sierra Research lanzó τ-bench 1.0.1, que corrige el esquema de evaluación de la tarea `banking_knowledge` para dejar de penalizar a los agentes por lecturas de verificación prudentes y soluciona varias inconsistencias en los datos. La actualización asegura que la reevaluación de las trayectorias del ranking solo aumente las puntuaciones, sin que simulaciones que anteriormente aprobadas fallen.

  • Las llamadas adicionales de lectura de base de datos que no estaban en la trayectoria dorada ya no anulan la recompensa envenenando la comparación del hash de la BD.
  • Los argumentos numéricos de las herramientas se normalizan para evitar que la escritura de enteros frente a flotantes altere los IDs de registro deterministas.
  • Las trayectorias doradas para las tareas 077–086 ahora incluyen lecturas necesarias para escenarios de tarjetas perdidas/robadas.
  • Los saldos de transacciones de cuentas bancarias se ordenan por fecha descendente para resolver correctamente los empates.
  • Se han corregido las tasas contradictorias de cash-back en el documento de conocimiento Platinum Rewards y las tarifas de cajero automático subreembolsadas en task_074.

La reevaluación muestra aumentos en las puntuaciones para todos los modelos, con gpt-5-5 ganando 9.02 puntos pass^1. Los usuarios pueden reevaluar sus propios resultados usando la nueva bandera `--fresh-tasks` o fijarse en la etiqueta `pre-v1.0.1` para reproducir las puntuaciones anteriores.