Benchmark · agentic

Terminal-Bench

30 परिणाम 20 मॉडल

Terminal-Bench मापता है कि AI एजेंट टर्मिनल में असली command-line कार्य कितनी अच्छी तरह पूरे करते हैं — जैसे software इंस्टॉल करना, debugging और सिस्टम ऑपरेशन। स्कोर उन कार्यों का प्रतिशत है जिन्हें एजेंट सफलतापूर्वक पूरा करता है।

और पढ़ें
उदाहरण
एक सामान्य कार्य में एजेंट को एक टूटा हुआ या खाली environment दिया जाता है और उसे काम करने की स्थिति तक लाने को कहा जाता है — उदाहरण के लिए, सही dependencies इंस्टॉल करना और configuration ठीक करना ताकि कोई program चले, यह सब टर्मिनल commands के ज़रिए।
स्कोरिंग
हर कार्य को इस आधार पर pass या fail आँका जाता है कि एजेंट ने ज़रूरी अंतिम स्थिति हासिल की या नहीं, और benchmark स्कोर कुल में से हल किए गए कार्यों का प्रतिशत होता है।
सत्यापन
कोई परिणाम तभी स्वीकार होता है जब एक अलग-थलग (sandbox) environment में स्वचालित जाँचें पुष्टि करें कि कार्य का इच्छित परिणाम प्राप्त हुआ — न कि मानव वोट या सटीक text मिलान से।
यह क्यों मायने रखता है
command line से software इंस्टॉल करना, debugging और सिस्टम चलाना जैसे टर्मिनल कौशल असली इंजीनियरिंग कार्य के केंद्र में हैं, इसलिए यह benchmark दिखाता है कि कोई एजेंट असली command line में स्वायत्त और भरोसेमंद ढंग से काम कर सकता है या नहीं। इसका कठिन 2.x संस्करण एजेंटों के बेहतर होने के साथ मानक ऊँचा बनाए रखता है।
हल किया गया उदाहरण
कार्य
Terminal-Bench के एक Docker कंटेनर में, फ़ाइल /app/access.log में Apache के एक्सेस लॉग हैं। एक ही कमांड लिखें जो अलग-अलग क्लाइंट IP पतों की संख्या गिने (हर पंक्ति का पहला स्पेस-विभाजित फ़ील्ड) और केवल वही संख्या /app/answer.txt में सहेजे।
समाधान
awk '{print $1}' /app/access.log | sort -u | wc -l > /app/answer.txt
व्याख्या
awk हर लॉग पंक्ति का पहला फ़ील्ड (क्लाइंट IP) छापता है, sort -u डुप्लिकेट हटाता है, और wc -l शेष यूनिक IP गिनता है, परिणाम /app/answer.txt में रीडायरेक्ट होता है। Terminal-Bench कंटेनर में एक pytest टेस्ट चलाकर मूल्यांकन करता है जो /app/answer.txt पढ़ता है और जाँचता है कि यह ज्ञात यूनिक IP संख्या के बराबर है।
0 24.5 49 73.5 98 2025-05-22 2026-01-22 2026-09-25 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-23 Claude Sonnet 4 · 35.5 · 2025-05-23 Claude Sonnet 4.5 · 50 · 2025-09-30 GLM-4.6 · 40.5 · 2025-09-30 Claude Opus 4.5 · 59.3 · 2025-11-25 Claude Opus 4.6 · 65.4 · 2026-02-05 Composer 2 · 61.7 · 2026-03-27 GPT-5.6 Sol · 88.8 · 2026-06-26 GPT-5.6 Sol (ultra mode) · 91.9 · 2026-06-26 GLM-5.2 (753B MoE) · 70.8 · 2026-07-08 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 Kimi K2.6 · 73 · 2026-07-29 GPT-5.5 · 69 · 2026-07-29 Kimi K3 · 32 · 2026-07-29 Claude Fable 5.1 · 55.8 · 2026-09-01 Claude Mythos 5.1 · 60.9 · 2026-09-01 Claude Opus 5.5 · 59.6 · 2026-09-25
Claude Opus 4 Claude Sonnet 4 Claude Sonnet 4.5 GLM-4.6 Claude Opus 4.5 Claude Opus 4.6 Composer 2 GPT-5.6 Sol GPT-5.6 Sol (ultra mode) GLM-5.2 (753B MoE) RELAI-VCL GEPA Meta Harness baseline agent Kimi K2.6 GPT-5.5 Kimi K3 Claude Fable 5.1 Claude Mythos 5.1 Claude Opus 5.5
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-09-25 Claude Opus 5.5 59.6% Anthropic ने Claude Opus 5.5 जारी किया; TypeSafe ने Jev वर्गीकरण मॉडल लॉन्च किया
2026-09-01 Claude Fable 5.1 55.8% Anthropic ने Claude Fable 5.1 को Terminal-Bench-Science पर 52.6% और सस्ते कैश रीड के साथ जारी किया
2026-09-01 Claude Mythos 5.1 60.9% Anthropic ने Claude Fable 5.1 को Terminal-Bench-Science पर 52.6% और सस्ते कैश रीड के साथ जारी किया
2026-07-29 Kimi K2.6 73.0% Fireworks AI ने लागत नियंत्रण के लिए Fireworks Nexus रूटिंग परत जारी की
2026-07-29 GPT-5.5 69.0% Fireworks AI ने लागत नियंत्रण के लिए Fireworks Nexus रूटिंग परत जारी की
2026-07-29 Kimi K3 32.0% Fireworks AI ने लागत नियंत्रण के लिए Fireworks Nexus रूटिंग परत जारी की
2026-07-16 baseline agent 58.7% Terminal-Bench 2.0 पर RELAI-VCL अनुकूलन में लाभ
2026-07-16 Meta Harness 64.6% Terminal-Bench 2.0 पर RELAI-VCL अनुकूलन में लाभ
2026-07-16 GEPA 66.0% Terminal-Bench 2.0 पर RELAI-VCL अनुकूलन में लाभ
2026-07-16 RELAI-VCL 76.4% Terminal-Bench 2.0 पर RELAI-VCL अनुकूलन में लाभ
2026-07-16 baseline agent 58.7% RELAI-VCL निरंतर शिक्षा के माध्यम से एजेंट-ऑप्टिमाइज़र लाभों को संयुक्त करता है
2026-07-16 RELAI-VCL 76.4% RELAI-VCL निरंतर शिक्षा के माध्यम से एजेंट-ऑप्टिमाइज़र लाभों को संयुक्त करता है
2026-07-16 GEPA 66.0% RELAI-VCL निरंतर शिक्षा के माध्यम से एजेंट-ऑप्टिमाइज़र लाभों को संयुक्त करता है
2026-07-16 Meta Harness 64.6% RELAI-VCL निरंतर शिक्षा के माध्यम से एजेंट-ऑप्टिमाइज़र लाभों को संयुक्त करता है
2026-07-16 RELAI-VCL 76.4% RELAI-VCL निरंतर शिक्षण के माध्यम से एजेंट-ऑप्टिमाइजर लाभों को संयोजित करता है
2026-07-16 GEPA 66.0% RELAI-VCL निरंतर शिक्षण के माध्यम से एजेंट-ऑप्टिमाइजर लाभों को संयोजित करता है
2026-07-16 Meta Harness 64.6% RELAI-VCL निरंतर शिक्षण के माध्यम से एजेंट-ऑप्टिमाइजर लाभों को संयोजित करता है
2026-07-16 baseline agent 58.7% RELAI-VCL निरंतर शिक्षण के माध्यम से एजेंट-ऑप्टिमाइजर लाभों को संयोजित करता है
2026-07-08 GLM-5.2 (753B MoE) 70.8% GLM-5.2 4-bit, 4× DGX Spark पर Terminal-Bench 2.1 में 70.8% स्कोर प्राप्त करता है
2026-06-26 GPT-5.6 Sol 88.8% OpenAI ने कोडिंग में रिकॉर्ड के साथ GPT-5.6 Sol को सॉफ्ट-लॉन्च किया, लेकिन धोखाधड़ी की समस्याओं को स्वीकार किया
2026-06-26 GPT-5.6 Sol (ultra mode) 91.9% OpenAI ने कोडिंग में रिकॉर्ड के साथ GPT-5.6 Sol को सॉफ्ट-लॉन्च किया, लेकिन धोखाधड़ी की समस्याओं को स्वीकार किया
2026-03-27 Composer 2 61.7pts Cursor ने एजेंटिक कोडिंग मॉडल ट्रेनिंग पर Composer 2 तकनीकी रिपोर्ट जारी की
2026-02-05 Claude Opus 4.6 65.4% Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2025-11-25 Claude Opus 4.5 59.3% Anthropic ने कोडिंग और कंप्यूटर उपयोग में अत्याधुनिक क्षमताओं के साथ Claude Opus 4.5 जारी किया
2025-09-30 Claude Sonnet 4.5 50.0% Anthropic ने कोडिंग और एजेंट क्षमताओं में सुधार के साथ Claude Sonnet 4.5 जारी किया
2025-09-30 GLM-4.6 40.5% Zhipu AI ने एजेंटिक क्षमताओं और 128k संदर्भ विंडो के साथ GLM-4.6 जारी किया
2025-05-23 Claude Sonnet 4 35.5% Anthropic ने हाइब्रिड तर्कशक्ति के साथ Claude Opus 4 और Sonnet 4 जारी किए
2025-05-23 Claude Opus 4 43.2% Anthropic ने हाइब्रिड तर्कशक्ति के साथ Claude Opus 4 और Sonnet 4 जारी किए
2025-05-22 Claude Opus 4 43.2% Anthropic ने Claude Opus 4 और Sonnet 4 को ASL-3 सुरक्षा उपायों के साथ जारी किया
2025-05-22 Claude Opus 4 43.2% एन्थ्रोपिक ने क्लॉड ओपस 4 और सनेट 4 को विस्तृत चिंतन और टूल उपयोग के साथ पेश किया