Sierra Research は τ-bench 1.0.1 をリリースし、`banking_knowledge` タスクの採点スキームを修正して、慎重な検証読み取りに対してエージェントがペナルティを受けないようにし、いくつかのデータの不整合を修正しました。このアップデートにより、リーダーボードの再採点でスコアが増加するだけで、以前合格していたシミュレーションが不合格になることはありません。
- ゴールデン・トラジェクトリに含まれていなかった追加のデータベース読み取り呼び出しは、DBハッシュ比較を妨害することで報酬をゼロにすることはありませんでした。
- 数値ツール引数は正規化され、整数と浮動小数点の表記の違いが決定論的なレコードIDに影響を与えないようにしました。
- タスク 077–086 のゴールド・トラジェクトリには、紛失・盗難カードシナリオに必要な読み取りが含まれるようになりました。
- 銀行口座の取引出力は日付降順にソートされ、タイブレーカーが正しく解決されます。
- プラチナ報酬の知識文書における矛盾したキャッシュバック率と、タスク_074 の過少払い ATM 手数料が修正されました。
再採点によりすべてのモデルでスコアの上昇が見られ、gpt-5-5 は pass^1 ポイントで 9.02 上昇しました。ユーザーは新しい `--fresh-tasks` フラグを使用して自分の結果を再採点するか、`pre-v1.0.1` タグに固定して以前のスコアを再現できます。