أصدرت Sierra Research الإصدار τ-bench 1.0.1، الذي يصحح مخطط تقييم مهمة `banking_knowledge` لوقف معاقبة الوكلاء على قراءات التحقق الحذرة، ويُصلح عدة تناقضات في البيانات. يضمن التحديث أن إعادة التقييم لمسارات لوحة المتصدرين تزيد الدرجات فقط، دون فشل أي محاكاة كانت قد نجحت سابقاً.

  • لم تعد استدعاءات قراءة قاعدة البيانات الإضافية التي لم تكن موجودة في المسار الذهبي تصفر المكافأة عن طريق تسميم مقارنة تجزئة قاعدة البيانات (DB-hash).
  • تُطبع حجة الأدوات الرقمية لمنع اختلاف تهجئة الأعداد الصحيحة عن الكسور العشرية من تغيير معرّفات السجلات الحتمية.
  • تتضمن المسارات الذهبية للمهام 077–086 الآن القراءات الضرورية لسيناريوهات البطاقات المفقودة أو المسروقة.
  • تُرتب مخرجات معاملات الحسابات المصرفية حسب التاريخ تنازلياً لحل التعادلات بشكل صحيح.
  • تم تصحيح معدلات الكاش باك المتناقضة في وثيقة معرفة Platinum Rewards والرسوم غير المدفوعة بالكامل لأجهزة الصراف الآلي في المهمة task_074.

أظهرت إعادة التقييم تحركات صاعدة في الدرجات لجميع النماذج، حيث اكتسب gpt-5-5 9.02 نقطة من نقاط النجاح^1. يمكن للمستخدمين إعادة تقييم نتائجهم الخاصة باستخدام العلم `--fresh-tasks` الجديد أو تثبيت العلامة على `pre-v1.0.1` لإعادة إنتاج الدرجات السابقة.