Sierra Research выпустила τ-bench 1.0.1, которая корректирует схему оценки задачи `banking_knowledge`, прекращая наказание агентов за тщательные проверки и исправляя несколько несоответствий в данных. Обновление гарантирует, что пересчёт траекторий в лидерборде только увеличивает баллы, при этом ранее прошедшие симуляции не проваливаются.
- Дополнительные вызовы чтения базы данных, отсутствовавшие в золотой траектории, больше не обнуляют награду из-за искажения сравнения DB-hash.
- Числовые аргументы инструментов нормализуются, чтобы различия в записи целых и дробных чисел не изменяли детерминированные идентификаторы записей.
- Золотые траектории для задач 077–086 теперь включают необходимые чтения для сценариев утери/кражи карты.
- Выводы транзакций банковских счетов сортируются по дате по убыванию для корректного разрешения ничьих.
- Исправлены противоречивые ставки кэшбэка в документации Platinum Rewards и недоплату комиссий за снятие наличных в ATM в задаче_074.
Пересчёт показал рост баллов для всех моделей, при этом gpt-5-5 набрал на 9.02 балла pass^1 больше. Пользователи могут пересчитать свои результаты с помощью нового флага `--fresh-tasks` или зафиксироваться на теге `pre-v1.0.1`, чтобы воспроизвести предыдущие баллы.