Sierra Research가 τ-bench 1.0.1을 출시하여 `banking_knowledge` 작업의 채점 방식을 수정하고, 신중한 검증 읽기 수행에 대해 에이전트에 페널티를 부과하지 않도록 하며 여러 데이터 불일치를 수정했습니다. 이 업데이트는 리더보드 재채점 시 점수가 상승만 하도록 보장하며, 이전에 통과했던 시뮬레이션이 실패하지 않습니다.
- 골든 트래젝토리에 없었던 추가 데이터베이스 읽기 호출은 DB 해시 비교를 오염시켜 보상을 0으로 만드는 일이 더 이상 발생하지 않습니다.
- 숫자 도구 인수는 정수와 부동소수점 표기법이 결정론적 레코드 ID에 영향을 주지 않도록 정규화됩니다.
- 작업 077–086의 골든 트래젝토리는 분실/도난 카드 시나리오에 필요한 읽기 작업을 포함하도록 업데이트되었습니다.
- 은행 계좌 거래 내역은 동점 해결을 올바르게 처리하기 위해 날짜 역순으로 정렬됩니다.
- Platinum Rewards 지식 문서의 상충되는 캐시백 비율과 작업_074에서 과소 청구된 ATM 수수료가 수정되었습니다.
재채점 결과 모든 모델의 점수가 상승했으며, gpt-5-5는 pass^1 기준 9.02점이 증가했습니다. 사용자는 새로운 `--fresh-tasks` 플래그를 사용하여 자신의 결과를 재채점하거나 이전 점수를 재현하기 위해 `pre-v1.0.1` 태그에 고정할 수 있습니다.