A Sierra Research lançou o τ-bench 1.0.1, que corrige o esquema de avaliação da tarefa `banking_knowledge` para parar de penalizar agentes por leituras prudentes de verificação e corrige várias inconsistências nos dados. A atualização garante que a reavaliação das trajetórias do ranking apenas aumente as pontuações, sem que simulações anteriormente aprovadas falhem.
- Chamadas extras de leitura ao banco de dados que não estavam na trajetória de referência agora não zeram a recompensa envenenando a comparação do hash do DB.
- Argumentos numéricos das ferramentas são normalizados para evitar que a grafia de inteiro vs. float altere os IDs de registro determinísticos.
- As trajetórias de referência para as tarefas 077–086 agora incluem leituras necessárias para cenários de cartão perdido/roubado.
- As saídas de transações de contas bancárias são ordenadas por data em ordem decrescente para resolver corretamente os empates.
- Taxas contraditórias de cashback no documento de conhecimento Platinum Rewards e taxas de caixa eletrônico subcompensadas na task_074 foram corrigidas.
A reavaliação mostra movimentos de pontuação para cima em todos os modelos, com gpt-5-5 ganhando 9.02 pontos pass^1. Os usuários podem reavaliar seus próprios resultados usando a nova flag `--fresh-tasks` ou fixar na tag `pre-v1.0.1` para reproduzir as pontuações anteriores.