IntelligenceLab ने Hugging Face से Long-Horizon-Terminal-Bench (LHTB) डेटासेट को बेंचमार्क अनुमत सूची में जोड़ने के लिए एक अनुरोध दाखिल किया है। इसका उद्देश्य Hugging Face Hub पर इस बेंचमार्क के लिए समुदाय मूल्यांकन परिणामों को एकीकृत करना है।

  • LHTB 46 कार्यों से बना है, जो यह परीक्षण करने के लिए डिज़ाइन किए गए हैं कि LLM एजेंट सैकड़ों चरणों में कंटेनराइज़्ड टर्मिनल में उपयोगी कार्य को कैसे बनाए रखते हैं।
  • यह एजेंट प्रदर्शन का आकलन करने के लिए स्व-रिपोर्ट किए गए प्रगति के बजाय छिपे हुए, आर्टिफैक्ट से पुनर्निर्माण करने वाले सत्यापकों का उपयोग करता है।
  • कार्यों को Harbor / Terminal-Bench 2.0 हार्नेस के माध्यम से निष्पादित किया जाता है, जिसमें eval.yaml फ़ाइल पहले से मौजूद और मान्य की गई है।