قدمت IntelligenceLab طلبًا إلى Hugging Face لإضافة مجموعة بيانات Long-Horizon-Terminal-Bench (LHTB) إلى القائمة المسموح بها للمعايير. الهدف هو تمكين تجميع نتائج تقييم المجتمع لهذا المعيار على Hugging Face Hub.

  • يتكون LHTB من 46 مهمة مصممة لاختبار مدى قدرة وكلاء LLM على الحفاظ على عمل مفيد في طرفية حاوية عبر مئات الخطوات.
  • يستخدم مُحقِّقات مخفية تُعاد بناؤها من القطع الأثرية بدلاً من التقدم المُبلغ عنه ذاتيًا لتقييم أداء الوكيل.
  • يتم تنفيذ المهام عبر إطار العمل Harbor / Terminal-Bench 2.0، مع وجود ملف eval.yaml بالفعل ومُتحقق منه في المستودع.