يقدم الباحثون T-Search، وهو مسترجع وكيل بوزن مفتوح مصمم لمهام البحث متعددة الخطوات الصعبة. مبني على Qwen3.6-35B-A3B ومدرب باستخدام بيانات اصطناعية تم تصفيتها بشكل عدائي، يقوم بتنفيذ عمليات بحث محدودة عبر جولات متعددة لإرجاع كتل أدلة مصنفة مع مبررات.

  • يحقق Recall@10 بقيمة 56.0 مع rollout واحد و61.3 مع ثلاث rollouts مدمجة عبر سبعة معايير تقييم باللغة الإنجليزية والروسية.
  • يتفوق على النماذج المفتوحة الأكبر حجماً مع ترك توليد الإجابات للنماذج اللاحقة لتبديل مرن.
  • يتضمن إصدار النموذج، والأداة (harness)، والعرض الحي، وTRuST، وهو أول معيار تقييم للبحث الصعب باللغة الروسية الأصلية.

يعتقد المؤلفون أن هذا مهم لأنه يسمح بتبديل مكونات الخلفية والمولد دون إعادة التدريب.