Benchmark · agentic
Terminal-Bench
Terminal-Bench मापता है कि AI एजेंट टर्मिनल में असली command-line कार्य कितनी अच्छी तरह पूरे करते हैं — जैसे software इंस्टॉल करना, debugging और सिस्टम ऑपरेशन। स्कोर उन कार्यों का प्रतिशत है जिन्हें एजेंट सफलतापूर्वक पूरा करता है।
और पढ़ें
- उदाहरण
- एक सामान्य कार्य में एजेंट को एक टूटा हुआ या खाली environment दिया जाता है और उसे काम करने की स्थिति तक लाने को कहा जाता है — उदाहरण के लिए, सही dependencies इंस्टॉल करना और configuration ठीक करना ताकि कोई program चले, यह सब टर्मिनल commands के ज़रिए।
- स्कोरिंग
- हर कार्य को इस आधार पर pass या fail आँका जाता है कि एजेंट ने ज़रूरी अंतिम स्थिति हासिल की या नहीं, और benchmark स्कोर कुल में से हल किए गए कार्यों का प्रतिशत होता है।
- सत्यापन
- कोई परिणाम तभी स्वीकार होता है जब एक अलग-थलग (sandbox) environment में स्वचालित जाँचें पुष्टि करें कि कार्य का इच्छित परिणाम प्राप्त हुआ — न कि मानव वोट या सटीक text मिलान से।
- यह क्यों मायने रखता है
- command line से software इंस्टॉल करना, debugging और सिस्टम चलाना जैसे टर्मिनल कौशल असली इंजीनियरिंग कार्य के केंद्र में हैं, इसलिए यह benchmark दिखाता है कि कोई एजेंट असली command line में स्वायत्त और भरोसेमंद ढंग से काम कर सकता है या नहीं। इसका कठिन 2.x संस्करण एजेंटों के बेहतर होने के साथ मानक ऊँचा बनाए रखता है।
हल किया गया उदाहरण
कार्य
Terminal-Bench के एक Docker कंटेनर में, फ़ाइल /app/access.log में Apache के एक्सेस लॉग हैं। एक ही कमांड लिखें जो अलग-अलग क्लाइंट IP पतों की संख्या गिने (हर पंक्ति का पहला स्पेस-विभाजित फ़ील्ड) और केवल वही संख्या /app/answer.txt में सहेजे।
समाधान
awk '{print $1}' /app/access.log | sort -u | wc -l > /app/answer.txt
व्याख्या
awk हर लॉग पंक्ति का पहला फ़ील्ड (क्लाइंट IP) छापता है, sort -u डुप्लिकेट हटाता है, और wc -l शेष यूनिक IP गिनता है, परिणाम /app/answer.txt में रीडायरेक्ट होता है। Terminal-Bench कंटेनर में एक pytest टेस्ट चलाकर मूल्यांकन करता है जो /app/answer.txt पढ़ता है और जाँचता है कि यह ज्ञात यूनिक IP संख्या के बराबर है।