Benchmark · agentic

Terminal-Bench

27 परिणाम 17 मॉडल

Terminal-Bench मापता है कि AI एजेंट टर्मिनल में असली command-line कार्य कितनी अच्छी तरह पूरे करते हैं — जैसे software इंस्टॉल करना, debugging और सिस्टम ऑपरेशन। स्कोर उन कार्यों का प्रतिशत है जिन्हें एजेंट सफलतापूर्वक पूरा करता है।

और पढ़ें
उदाहरण
एक सामान्य कार्य में एजेंट को एक टूटा हुआ या खाली environment दिया जाता है और उसे काम करने की स्थिति तक लाने को कहा जाता है — उदाहरण के लिए, सही dependencies इंस्टॉल करना और configuration ठीक करना ताकि कोई program चले, यह सब टर्मिनल commands के ज़रिए।
स्कोरिंग
हर कार्य को इस आधार पर pass या fail आँका जाता है कि एजेंट ने ज़रूरी अंतिम स्थिति हासिल की या नहीं, और benchmark स्कोर कुल में से हल किए गए कार्यों का प्रतिशत होता है।
सत्यापन
कोई परिणाम तभी स्वीकार होता है जब एक अलग-थलग (sandbox) environment में स्वचालित जाँचें पुष्टि करें कि कार्य का इच्छित परिणाम प्राप्त हुआ — न कि मानव वोट या सटीक text मिलान से।
यह क्यों मायने रखता है
command line से software इंस्टॉल करना, debugging और सिस्टम चलाना जैसे टर्मिनल कौशल असली इंजीनियरिंग कार्य के केंद्र में हैं, इसलिए यह benchmark दिखाता है कि कोई एजेंट असली command line में स्वायत्त और भरोसेमंद ढंग से काम कर सकता है या नहीं। इसका कठिन 2.x संस्करण एजेंटों के बेहतर होने के साथ मानक ऊँचा बनाए रखता है।
हल किया गया उदाहरण
कार्य
Terminal-Bench के एक Docker कंटेनर में, फ़ाइल /app/access.log में Apache के एक्सेस लॉग हैं। एक ही कमांड लिखें जो अलग-अलग क्लाइंट IP पतों की संख्या गिने (हर पंक्ति का पहला स्पेस-विभाजित फ़ील्ड) और केवल वही संख्या /app/answer.txt में सहेजे।
समाधान
awk '{print $1}' /app/access.log | sort -u | wc -l > /app/answer.txt
व्याख्या
awk हर लॉग पंक्ति का पहला फ़ील्ड (क्लाइंट IP) छापता है, sort -u डुप्लिकेट हटाता है, और wc -l शेष यूनिक IP गिनता है, परिणाम /app/answer.txt में रीडायरेक्ट होता है। Terminal-Bench कंटेनर में एक pytest टेस्ट चलाकर मूल्यांकन करता है जो /app/answer.txt पढ़ता है और जाँचता है कि यह ज्ञात यूनिक IP संख्या के बराबर है।
0 24.5 49 73.5 98 2025-05-22 2025-12-24 2026-07-29 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-23 Claude Sonnet 4 · 35.5 · 2025-05-23 GLM-4.6 · 40.5 · 2025-09-30 Claude Sonnet 4.5 · 50 · 2025-09-30 Claude Opus 4.5 · 59.3 · 2025-11-25 Claude Opus 4.6 · 65.4 · 2026-02-05 Composer 2 · 61.7 · 2026-03-27 GPT-5.6 Sol (ultra mode) · 91.9 · 2026-06-26 GPT-5.6 Sol · 88.8 · 2026-06-26 GLM-5.2 (753B MoE) · 70.8 · 2026-07-08 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 Kimi K2.6 · 73 · 2026-07-29 GPT-5.5 · 69 · 2026-07-29 Kimi K3 · 32 · 2026-07-29
Claude Opus 4 Claude Sonnet 4 GLM-4.6 Claude Sonnet 4.5 Claude Opus 4.5 Claude Opus 4.6 Composer 2 GPT-5.6 Sol (ultra mode) GPT-5.6 Sol GLM-5.2 (753B MoE) RELAI-VCL Meta Harness GEPA baseline agent Kimi K2.6 GPT-5.5 Kimi K3
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-29 Kimi K2.6 73.0% Fireworks AI ने लागत नियंत्रण के लिए Fireworks Nexus रूटिंग परत जारी की
2026-07-29 GPT-5.5 69.0% Fireworks AI ने लागत नियंत्रण के लिए Fireworks Nexus रूटिंग परत जारी की
2026-07-29 Kimi K3 32.0% Fireworks AI ने लागत नियंत्रण के लिए Fireworks Nexus रूटिंग परत जारी की
2026-07-16 baseline agent 58.7% Terminal-Bench 2.0 पर RELAI-VCL अनुकूलन में लाभ
2026-07-16 Meta Harness 64.6% Terminal-Bench 2.0 पर RELAI-VCL अनुकूलन में लाभ
2026-07-16 GEPA 66.0% Terminal-Bench 2.0 पर RELAI-VCL अनुकूलन में लाभ
2026-07-16 RELAI-VCL 76.4% Terminal-Bench 2.0 पर RELAI-VCL अनुकूलन में लाभ
2026-07-16 Meta Harness 64.6% RELAI-VCL निरंतर शिक्षा के माध्यम से एजेंट-ऑप्टिमाइज़र लाभों को संयुक्त करता है
2026-07-16 RELAI-VCL 76.4% RELAI-VCL निरंतर शिक्षा के माध्यम से एजेंट-ऑप्टिमाइज़र लाभों को संयुक्त करता है
2026-07-16 GEPA 66.0% RELAI-VCL निरंतर शिक्षा के माध्यम से एजेंट-ऑप्टिमाइज़र लाभों को संयुक्त करता है
2026-07-16 baseline agent 58.7% RELAI-VCL निरंतर शिक्षा के माध्यम से एजेंट-ऑप्टिमाइज़र लाभों को संयुक्त करता है
2026-07-16 RELAI-VCL 76.4% RELAI-VCL निरंतर शिक्षण के माध्यम से एजेंट-ऑप्टिमाइजर लाभों को संयोजित करता है
2026-07-16 Meta Harness 64.6% RELAI-VCL निरंतर शिक्षण के माध्यम से एजेंट-ऑप्टिमाइजर लाभों को संयोजित करता है
2026-07-16 GEPA 66.0% RELAI-VCL निरंतर शिक्षण के माध्यम से एजेंट-ऑप्टिमाइजर लाभों को संयोजित करता है
2026-07-16 baseline agent 58.7% RELAI-VCL निरंतर शिक्षण के माध्यम से एजेंट-ऑप्टिमाइजर लाभों को संयोजित करता है
2026-07-08 GLM-5.2 (753B MoE) 70.8% GLM-5.2 4-bit, 4× DGX Spark पर Terminal-Bench 2.1 में 70.8% स्कोर प्राप्त करता है
2026-06-26 GPT-5.6 Sol (ultra mode) 91.9% OpenAI ने कोडिंग में रिकॉर्ड के साथ GPT-5.6 Sol को सॉफ्ट-लॉन्च किया, लेकिन धोखाधड़ी की समस्याओं को स्वीकार किया
2026-06-26 GPT-5.6 Sol 88.8% OpenAI ने कोडिंग में रिकॉर्ड के साथ GPT-5.6 Sol को सॉफ्ट-लॉन्च किया, लेकिन धोखाधड़ी की समस्याओं को स्वीकार किया
2026-03-27 Composer 2 61.7pts Cursor ने एजेंटिक कोडिंग मॉडल ट्रेनिंग पर Composer 2 तकनीकी रिपोर्ट जारी की
2026-02-05 Claude Opus 4.6 65.4% Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2025-11-25 Claude Opus 4.5 59.3% Anthropic ने कोडिंग और कंप्यूटर उपयोग में अत्याधुनिक क्षमताओं के साथ Claude Opus 4.5 जारी किया
2025-09-30 GLM-4.6 40.5% Zhipu AI ने एजेंटिक क्षमताओं और 128k संदर्भ विंडो के साथ GLM-4.6 जारी किया
2025-09-30 Claude Sonnet 4.5 50.0% Anthropic ने कोडिंग और एजेंट क्षमताओं में सुधार के साथ Claude Sonnet 4.5 जारी किया
2025-05-23 Claude Sonnet 4 35.5% Anthropic ने हाइब्रिड तर्कशक्ति के साथ Claude Opus 4 और Sonnet 4 जारी किए
2025-05-23 Claude Opus 4 43.2% Anthropic ने हाइब्रिड तर्कशक्ति के साथ Claude Opus 4 और Sonnet 4 जारी किए
2025-05-22 Claude Opus 4 43.2% एन्थ्रोपिक ने क्लॉड ओपस 4 और सनेट 4 को विस्तृत चिंतन और टूल उपयोग के साथ पेश किया
2025-05-22 Claude Opus 4 43.2% Anthropic ने Claude Opus 4 और Sonnet 4 को ASL-3 सुरक्षा उपायों के साथ जारी किया