Sierra Research 发布了 τ-bench 1.0.1,修正了 `banking_knowledge` 任务的评分方案,停止因审慎的验证读取而惩罚代理,并修复了若干数据不一致问题。此次更新确保重新评分排行榜轨迹仅提升分数,此前通过的模拟不再失败。
- 不在黄金轨迹中的额外数据库读取调用不再通过污染 DB-hash 比较将奖励归零。
- 数值工具参数已标准化,防止整数与浮点数拼写差异改变确定性记录 ID。
- 任务 077–086 的黄金轨迹现在包含丢失/被盗卡片场景所需的读取操作。
- 银行账户交易输出按日期降序排列,以正确解决平局情况。
- 白金奖励知识文档中相互矛盾的返现率以及 task_074 中 ATM 费用退款不足的问题已修正。
重新评分显示所有模型的分数均有所上升,gpt-5-5 获得了 9.02 pass^1 分。用户可使用新的 `--fresh-tasks` 标志对自己的结果进行重新评分,或固定到 `pre-v1.0.1` 标签以复现之前的分数。