قدمت IntelligenceLab طلبًا إلى Hugging Face لإضافة مجموعة بيانات Long-Horizon-Terminal-Bench (LHTB) إلى القائمة المسموح بها للمعايير. الهدف هو تمكين تجميع نتائج تقييم المجتمع لهذا المعيار على Hugging Face Hub.
- يتكون LHTB من 46 مهمة مصممة لاختبار مدى قدرة وكلاء LLM على الحفاظ على عمل مفيد في طرفية حاوية عبر مئات الخطوات.
- يستخدم مُحقِّقات مخفية تُعاد بناؤها من القطع الأثرية بدلاً من التقدم المُبلغ عنه ذاتيًا لتقييم أداء الوكيل.
- يتم تنفيذ المهام عبر إطار العمل Harbor / Terminal-Bench 2.0، مع وجود ملف eval.yaml بالفعل ومُتحقق منه في المستودع.