Sierra Research a publié τ-bench 1.0.1, qui corrige le schéma de notation de la tâche `banking_knowledge` afin d'arrêter de pénaliser les agents pour leurs vérifications prudentes et résout plusieurs incohérences de données. La mise à jour garantit que le re-notage des trajectoires du classement augmente uniquement les scores, sans qu'aucune simulation précédemment validée ne soit défaillante.
- Les appels de lecture de base de données supplémentaires qui n'étaient pas dans la trajectoire de référence ne neutralisent plus la récompense en corrompant la comparaison du hachage DB.
- Les arguments numériques des outils sont normalisés pour empêcher que l'orthographe entier vs flottant ne modifie les identifiants d'enregistrement déterministes.
- Les trajectoires de référence pour les tâches 077–086 incluent désormais les lectures nécessaires pour les scénarios de carte perdue/volée.
- Les sorties de transactions de compte bancaire sont triées par date décroissante pour résoudre correctement les égalités.
- Les taux de cash-back contradictoires dans la documentation Platinum Rewards et les frais de guichet automatique sous-indemnisés dans task_074 ont été corrigés.
Le re-notage montre des augmentations de score pour tous les modèles, avec gpt-5-5 gagnant 9.02 points pass^1. Les utilisateurs peuvent re-noter leurs propres résultats en utilisant le nouvel indicateur `--fresh-tasks` ou se fixer sur la balise `pre-v1.0.1` pour reproduire les scores précédents.