Benchmark · agentic

Terminal-Bench 2

40 परिणाम 31 मॉडल

Harbor/Terminus-2 89-task terminal-agent suite; 2.0 and 2.1 are the same task set, so one series. File here only when the quote says 2.0 / 2.1 / v2 — not the original suite (terminal-bench), and not the harder 'Terminal-Bench Hard' subset (not in this catalog).

0 25 50 75 100 2025-11-19 2026-04-15 2026-09-10 GPT-5.1-Codex-Max · 58.1 · 2025-11-19 Step 3.5 Flash · 51 · 2026-02-10 MiniMax M2.7 · 57 · 2026-04-12 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-25 Qwen3.6-27B · 59.3 · 2026-04-25 Qwen3.6-27B · 60.7 · 2026-08-10 GLM 5.2 FP8 with FP8 KV · 79.8 · 2026-07-05 LLM-as-a-Verifier · 86.5 · 2026-07-07 Grok 4.5 · 83.3 · 2026-07-08 hermes · 55 · 2026-07-08 Gemini 3.5 Flash-Lite · 54 · 2026-07-21 Gemini 3.5 Flash-Lite · 54 · 2026-07-21 Gemini 3.5 Flash-Lite · 54 · 2026-07-27 KAT-Coder-V2.5 · 60.7 · 2026-07-26 DeepSeek-V4-Flash · 82.7 · 2026-07-31 DeepSeek-V4-Flash · 79 · 2026-08-01 DeepSeek-V4-Flash-0731 · 82.7 · 2026-07-31 DeepSeek-V4-Flash-0731 · 82.7 · 2026-08-07 V4 Flash 0731 · 79 · 2026-08-01 Inkling-Small · 64.7 · 2026-08-03 Qwen3.8-Max · 86.6 · 2026-08-03 Qwen3.8-Max · 67.4 · 2026-08-05 Muse Spark 1.1 · 80 · 2026-08-05 Pokee-Isaac 28B · 65.1 · 2026-08-08 DeepSeek V4 Flash 0731 · 82.7 · 2026-08-09 Opus 5 · 86.7 · 2026-08-11 Grok 4.6 · 88.4 · 2026-08-13 Grok 4.6 · 88.4 · 2026-08-21 DeepSeek-V4-Pro · 87.9 · 2026-08-13 Ornith-1.5 · 86.1 · 2026-08-19 agents · 94 · 2026-08-20 DeepSeek-V4-Flash-Vision-Exp · 83.9 · 2026-08-21 Granite 4.2 30B · 29.2 · 2026-08-26 Granite 4.2 8B · 20.6 · 2026-08-26 Muse Spark 1.3 · 88.8 · 2026-09-04 K2-Horizon-MoVA-36B-A4B · 58.6 · 2026-09-07 K2-Horizon-375B-A23B · 66.9 · 2026-09-07 DeepSeek-V4.1-Flash · 90.6 · 2026-09-10
GPT-5.1-Codex-Max Step 3.5 Flash MiniMax M2.7 GPT-5.5 Qwen3.6-27B GLM 5.2 FP8 with FP8 KV LLM-as-a-Verifier Grok 4.5 hermes Gemini 3.5 Flash-Lite KAT-Coder-V2.5 DeepSeek-V4-Flash DeepSeek-V4-Flash-0731 V4 Flash 0731 Inkling-Small Qwen3.8-Max Muse Spark 1.1 Pokee-Isaac 28B DeepSeek V4 Flash 0731 Opus 5 Grok 4.6 DeepSeek-V4-Pro Ornith-1.5 agents DeepSeek-V4-Flash-Vision-Exp Granite 4.2 30B Granite 4.2 8B Muse Spark 1.3 K2-Horizon-MoVA-36B-A4B K2-Horizon-375B-A23B DeepSeek-V4.1-Flash
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-09-10 DeepSeek-V4.1-Flash 90.6% DeepSeek ने मूल बहुआयामी समर्थन के साथ V4.1-Flash मॉडल जारी किया
2026-09-07 K2-Horizon-MoVA-36B-A4B 58.6% IFM ने K2 Horizon जारी किया: 0.9B से 375B तक के छह Apache 2.0 मॉडल
2026-09-07 K2-Horizon-375B-A23B 66.9% IFM ने K2 Horizon जारी किया: 0.9B से 375B तक के छह Apache 2.0 मॉडल
2026-09-04 Muse Spark 1.3 88.8% Meta ने Muse Spark 1.3 जारी किया है जिसमें कम टूल कॉल और टोकन हैं
2026-08-26 Granite 4.2 30B 29.24% IBM ने खुले उद्योग मॉडलों के लिए स्वदेशी तर्क और एजेंटिक RL के साथ Granite 4.2 जारी किया
2026-08-26 Granite 4.2 8B 20.56% IBM ने खुले उद्योग मॉडलों के लिए स्वदेशी तर्क और एजेंटिक RL के साथ Granite 4.2 जारी किया
2026-08-21 Grok 4.6 88.4% SpaceXAI ने एजेंटिक कार्य के लिए Cursor डेटा के साथ Grok 4.6 पेश किया
2026-08-21 DeepSeek-V4-Flash-Vision-Exp 83.9% DeepSeek ने DeepSeek-V4-Flash-Vision-Exp मल्टीमोडल मॉडल जारी किया
2026-08-20 agents 94.0% मेटा ने म्यूज़ वीडियो को नेटिव ऑडियो के साथ रिलीज़ किया; स्ट्राइप ने ओपनरूटर को अधिग्रहित किया
2026-08-19 Ornith-1.5 86.1% Ornith-1.5 ने स्वयं-सुधार प्रशिक्षण के साथ 9B, 35B-A3B, और 397B मॉडल जारी किए
2026-08-13 DeepSeek-V4-Pro 87.9% DeepSeek-V4-Pro GA रिलीज ने एजेंट क्षमताओं को बढ़ाया और Responses API समर्थन जोड़ा
2026-08-13 Grok 4.6 88.4% xAI ने Grok 4.6 जारी किया; Alibaba ने Qwen3.8-MoE को खोला; DeepSeek V4 Pro GA
2026-08-11 Opus 5 86.74% ओरोबोरस स्व-विकासित एजेंट ने Opus 5 के साथ नए बेंचमार्क स्थापित किए
2026-08-10 Qwen3.6-27B 60.7% मेटा ने म्यूज़ ग्लिमर जारी किया, एक 30B ओपन-वेइट्स एजेंटिक मॉडल जो एक उपभोक्ता GPU पर चलता है
2026-08-09 DeepSeek V4 Flash 0731 82.7% DeepSeek V4 Flash 0731 ने सार्वजनिक हार्नेस में Terminal-Bench 2.1 पर 82.7% मिलाया
2026-08-08 Pokee-Isaac 28B 65.1% Pokee AI ने Pokee-Isaac 28B जारी किया, जो इन-बाउंड्री डिप्लॉयमेंट के लिए 10M-टोकन संदर्भ मॉडल है
2026-08-07 DeepSeek-V4-Flash-0731 82.7% DeepSeek ने V4-Flash-0731 जारी किया, कम लागत में V4-Pro से बेहतर प्रदर्शन
2026-08-05 Muse Spark 1.1 80.0% मेटा ने म्यूज़ स्पार्क 1.2 से संचालित म्यूज़ कोड बीटा टर्मिनल एजेंट जारी किया
2026-08-05 Qwen3.8-Max 67.4% अलibaba ने 2.4T पैरामीटर और आगामी ओपन वेट्स के साथ Qwen3.8-Max की घोषणा की
2026-08-03 Qwen3.8-Max 86.6% अलibaba ने 2.4T-पैरामीटर MoE मॉडल Qwen3.8-Max जारी किया
2026-08-03 Inkling-Small 64.7% थिंकिंग मशीन्स लैब ने 276B ओपन वेट्स मल्टीमोडल MoE मॉडल इंकलिंग-स्माल रिलीज़ किया
2026-08-01 V4 Flash 0731 79.0% DeepSeek ने V4-Flash जारी किया, जिसमें प्रशिक्षण के बाद महत्वपूर्ण सुधार और ओपन वेट्स हैं
2026-08-01 DeepSeek-V4-Flash 79.0% DeepSeek ने पोस्ट-ट्रेनिंग लाभ और ओपन वेट्स के साथ V4-Flash जारी किया
2026-07-31 DeepSeek-V4-Flash-0731 82.7% DeepSeek ने कम लागत में प्रमुख एजेंटिक सुधारों के साथ V4-Flash-0731 जारी किया
2026-07-31 DeepSeek-V4-Flash 82.7% DeepSeek ने एजेंट क्षमताओं में वृद्धि के साथ DeepSeek-V4-Flash को सार्वजनिक बीटा में जारी किया
2026-07-27 Gemini 3.5 Flash-Lite 54.0% गूगल ने गेमिनी 3.6 फ्लैश, 3.5 फ्लैश-लाइट और 3.5 फ्लैश साइबर जारी किए
2026-07-26 KAT-Coder-V2.5 60.7% KwaiKAT ने KAT-Coder-V2.5 जारी किया, जो 100,000+ सत्यापित वातावरणों पर प्रशिक्षित एक एजेंटिक कोडिंग मॉडल है
2026-07-21 Gemini 3.5 Flash-Lite 54.0% एजेंटिक लोड के लिए Google ने Gemini 3.6 Flash, 3.5 Flash-Lite और 3.5 Flash Cyber जारी किए
2026-07-21 Gemini 3.5 Flash-Lite 54.0% गूगल ने गेमिनी 3.6 फ्लैश, 3.5 फ्लैश-लाइट और 3.5 फ्लैश साइबर जारी किए
2026-07-08 hermes 55.0% उपयोगकर्ताओं ने Mimo v2.5 की तुलना DeepSeek V4 Flash और Hermes से की
2026-07-08 Grok 4.5 83.3% xAI ने कम लागत और मिश्रित बेंचमार्क प्रदर्शन के साथ Grok 4.5 जारी किया
2026-07-07 LLM-as-a-Verifier 86.5% LLM-as-a-Verifier ने निरंतर स्कोरिंग के साथ सामान्य उद्देश्य सत्यापन ढांचा पेश किया
2026-07-05 GLM 5.2 FP8 with FP8 KV 79.8% GLM 5.2 FP8 with FP8 KV ने Terminal-Bench 2.1 पर 79.8% हासिल किया
2026-04-25 Qwen3.6-27B 59.3% अलिबाबा ने Qwen3.6-27B जारी किया, कोडिंग बेंचमार्क्स पर बड़े पूर्ववर्ती को हराया
2026-04-25 GPT-5.5 82.7% OpenAI ने GPT-5.5 जारी किया, एक नई आधार से पुनः प्रशिक्षित मॉडल जिसमें मूल ओमिमोडल प्रोसेसिंग है
2026-04-23 GPT-5.5 82.7% ओपनएआई ने एजेंटिक क्षमताओं और दोगुनी एपीआई मूल्य निर्धारण के साथ जीपीटी-5.5 जारी की
2026-04-23 GPT-5.5 82.7% OpenAI ने API के माध्यम से GPT-5.5 और GPT-5.5 Pro जारी किया
2026-04-12 MiniMax M2.7 57.0% MiniMax ने M2.7 को ओपन-सोर्स किया, जो SWE-Pro पर 56.22% स्कोर करने वाला एक स्व-विकासशील MoE मॉडल है
2026-02-10 Step 3.5 Flash 51.0% चरण 3.5 फ्लैश: खुला 11B-सक्रिय MoE मॉडल अग्रणी स्तर की एजेंटिक प्रदर्शन प्राप्त करता है
2025-11-19 GPT-5.1-Codex-Max 58.1% OpenAI ने Codex CLI में GPT-5.1-Codex-Max को डिफ़ॉल्ट बना दिया