Sierra Research merilis τ-bench 1.0.1, yang memperbaiki skema penilaian tugas `banking_knowledge` untuk menghentikan hukuman terhadap agen karena verifikasi bacaan yang bijaksana dan memperbaiki beberapa inkonsistensi data. Pembaruan ini memastikan bahwa penilai ulang lintasan papan peringkat hanya meningkatkan skor, tanpa simulasi yang sebelumnya lulus menjadi gagal.
- Panggilan baca database tambahan yang tidak ada dalam lintasan emas kini tidak lagi mengosongkan hadiah dengan meracuni perbandingan hash DB.
- Argumen alat numerik dinormalisasi untuk mencegah ejaan integer vs. float mengubah ID catatan deterministik.
- Lintasan emas untuk tugas 077–086 sekarang mencakup bacaan yang diperlukan untuk skenario kartu hilang/curian.
- Output transaksi rekening bank diurutkan berdasarkan tanggal menurun untuk menyelesaikan pemecah seri dengan benar.
- Tingkat cashback yang kontradiktif dalam dokumen pengetahuan Platinum Rewards dan biaya ATM yang kurang dibayar pada task_074 telah diperbaiki.
Penilaian ulang menunjukkan pergerakan skor naik untuk semua model, dengan gpt-5-5 mendapatkan 9.02 poin pass^1. Pengguna dapat menilai ulang hasil mereka sendiri menggunakan flag `--fresh-tasks` baru atau mengunci ke tag `pre-v1.0.1` untuk mereproduksi skor sebelumnya.