Sierra Research lanzó τ-bench 1.0.1, que corrige el esquema de evaluación de la tarea `banking_knowledge` para dejar de penalizar a los agentes por lecturas de verificación prudentes y soluciona varias inconsistencias en los datos. La actualización asegura que la reevaluación de las trayectorias del ranking solo aumente las puntuaciones, sin que simulaciones que anteriormente aprobadas fallen.
- Las llamadas adicionales de lectura de base de datos que no estaban en la trayectoria dorada ya no anulan la recompensa envenenando la comparación del hash de la BD.
- Los argumentos numéricos de las herramientas se normalizan para evitar que la escritura de enteros frente a flotantes altere los IDs de registro deterministas.
- Las trayectorias doradas para las tareas 077–086 ahora incluyen lecturas necesarias para escenarios de tarjetas perdidas/robadas.
- Los saldos de transacciones de cuentas bancarias se ordenan por fecha descendente para resolver correctamente los empates.
- Se han corregido las tasas contradictorias de cash-back en el documento de conocimiento Platinum Rewards y las tarifas de cajero automático subreembolsadas en task_074.
La reevaluación muestra aumentos en las puntuaciones para todos los modelos, con gpt-5-5 ganando 9.02 puntos pass^1. Los usuarios pueden reevaluar sus propios resultados usando la nueva bandera `--fresh-tasks` o fijarse en la etiqueta `pre-v1.0.1` para reproducir las puntuaciones anteriores.