Benchmark · agentic

AgentBench

0 परिणाम 0 मॉडल

AgentBench, LLM को इंटरैक्टिव एजेंट के रूप में 8 अलग-अलग वातावरणों (कोड, गेम और वेब कार्य) में परखता है और बहु-चरण निर्णय-क्षमता मापता है; हर वातावरण अपना अलग स्कोर देता है, जिन्हें एक भारित Overall Score में जोड़ा जाता है।

और पढ़ें
उदाहरण
«ऑपरेटिंग सिस्टम» वातावरण का कार्य: एजेंट को प्राकृतिक भाषा में एक लक्ष्य दिया जाता है (जैसे किसी शर्त पर खरी फ़ाइलों की गिनती, या किसी फ़ाइल की अनुमतियाँ बदलना), और वह चरण-दर-चरण bash कमांड चलाता है, हर आउटपुट पढ़ता है, फिर अंतिम उत्तर भेजता है या shell को अपेक्षित स्थिति में छोड़ देता है।
स्कोरिंग
हर वातावरण का अपना मापदंड है — सफलता दर (OS, DB, House-Holding), F1 (नॉलेज ग्राफ़), औसत इनाम (Web Shopping), चरण/तत्व सटीकता (वेब ब्राउज़िंग), या गेम प्रगति/इनाम (कार्ड गेम, पहेलियाँ)। मुख्य Overall Score आठ वातावरणों के स्कोर का भारित औसत है, जिसमें भार इस तरह चुने जाते हैं कि कठिनाई संतुलित रहे और कोई एक आसान कार्य हावी न हो।
सत्यापन
हर कार्य एक निष्पादन-योग्य वातावरण में चलता है जिसमें एक स्वचालित, निर्धारक जाँचकर्ता होता है: एजेंट के बहु-चरण पथ की पुष्टि प्रोग्राम द्वारा होती है (जैसे shell जाँच स्क्रिप्ट, डेटाबेस की अंतिम स्थिति, WebShop इनाम, या संदर्भ क्रियाओं से मिलान)। कोई मानव निर्णायक नहीं; अंतःक्रियाओं की अधिकतम राउंड सीमा होती है, और सीमा पार करना या अमान्य क्रिया देना विफलता गिना जाता है।
यह क्यों मायने रखता है
यह पहले मानकीकृत बेंचमार्कों में से एक था जो LLM को एकल-चरण उत्तरदाता के बजाय एजेंट के रूप में परखता है — दीर्घ-क्षितिज तर्क, उपकरण उपयोग और त्रुटि-सुधार का परीक्षण करते हुए; इसने वास्तविक एजेंटिक कार्यों पर शीर्ष वाणिज्यिक API मॉडल और ओपन-सोर्स मॉडल के बीच बड़ा अंतर उजागर किया।
हल किया गया उदाहरण
कार्य
«ऑपरेटिंग सिस्टम» वातावरण। Ubuntu के bash shell में एजेंट से कहा जाता है: «इस सिस्टम में कितने उपयोगकर्ता खातों का लॉगिन shell /bin/bash है? संख्या बताएँ।» उत्तर देने से पहले वह कई राउंड में कुछ shell कमांड चला सकता है।
समाधान
grep -c ':/bin/bash$' /etc/passwd
व्याख्या
/etc/passwd की हर पंक्ति का कोलन-पृथक सातवाँ फ़ील्ड लॉगिन shell होता है, इसलिए :/bin/bash पर समाप्त होने वाली पंक्तियों की गिनती bash-लॉगिन खातों की संख्या देती है; एजेंट कमांड आउटपुट से यह संख्या पढ़कर वातावरण की answer(N) क्रिया द्वारा लौटाता है। मूल्यांकन: OS जाँचकर्ता एक सत्यापन स्क्रिप्ट चलाता है और सबमिशन को द्विआधारी सफलता/विफलता के रूप में अंक देता है।

इस benchmark के लिए अभी तक कोई सत्यापित स्कोर रिपोर्ट नहीं किया गया है।