Benchmark · agentic

Terminal-Bench 2

13 परिणाम 10 मॉडल

Harbor/Terminus-2 89-task terminal-agent suite; 2.0 and 2.1 are the same task set, so one series. File here only when the quote says 2.0 / 2.1 / v2 — not the original suite (terminal-bench), and not the harder 'Terminal-Bench Hard' subset (not in this catalog).

0 23 46 69 92 2025-11-19 2026-03-21 2026-07-21 GPT-5.1-Codex-Max · 58.1 · 2025-11-19 Step 3.5 Flash · 51 · 2026-02-10 MiniMax M2.7 · 57 · 2026-04-12 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-25 Qwen3.6-27B · 59.3 · 2026-04-25 GLM 5.2 FP8 with FP8 KV · 79.8 · 2026-07-05 LLM-as-a-Verifier · 86.5 · 2026-07-07 Grok 4.5 · 83.3 · 2026-07-08 hermes · 55 · 2026-07-08 Gemini 3.5 Flash-Lite · 54 · 2026-07-21 Gemini 3.5 Flash-Lite · 54 · 2026-07-21
GPT-5.1-Codex-Max Step 3.5 Flash MiniMax M2.7 GPT-5.5 Qwen3.6-27B GLM 5.2 FP8 with FP8 KV LLM-as-a-Verifier Grok 4.5 hermes Gemini 3.5 Flash-Lite
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-21 Gemini 3.5 Flash-Lite 54.0% एजेंटिक लोड के लिए Google ने Gemini 3.6 Flash, 3.5 Flash-Lite और 3.5 Flash Cyber जारी किए
2026-07-21 Gemini 3.5 Flash-Lite 54.0% गूगल ने गेमिनी 3.6 फ्लैश, 3.5 फ्लैश-लाइट और 3.5 फ्लैश साइबर जारी किए
2026-07-08 hermes 55.0% उपयोगकर्ताओं ने Mimo v2.5 की तुलना DeepSeek V4 Flash और Hermes से की
2026-07-08 Grok 4.5 83.3% xAI ने कम लागत और मिश्रित बेंचमार्क प्रदर्शन के साथ Grok 4.5 जारी किया
2026-07-07 LLM-as-a-Verifier 86.5% LLM-as-a-Verifier ने निरंतर स्कोरिंग के साथ सामान्य उद्देश्य सत्यापन ढांचा पेश किया
2026-07-05 GLM 5.2 FP8 with FP8 KV 79.8% GLM 5.2 FP8 with FP8 KV ने Terminal-Bench 2.1 पर 79.8% हासिल किया
2026-04-25 Qwen3.6-27B 59.3% अलिबाबा ने Qwen3.6-27B जारी किया, कोडिंग बेंचमार्क्स पर बड़े पूर्ववर्ती को हराया
2026-04-25 GPT-5.5 82.7% OpenAI ने GPT-5.5 जारी किया, एक नई आधार से पुनः प्रशिक्षित मॉडल जिसमें मूल ओमिमोडल प्रोसेसिंग है
2026-04-23 GPT-5.5 82.7% OpenAI ने API के माध्यम से GPT-5.5 और GPT-5.5 Pro जारी किया
2026-04-23 GPT-5.5 82.7% ओपनएआई ने एजेंटिक क्षमताओं और दोगुनी एपीआई मूल्य निर्धारण के साथ जीपीटी-5.5 जारी की
2026-04-12 MiniMax M2.7 57.0% MiniMax ने M2.7 को ओपन-सोर्स किया, जो SWE-Pro पर 56.22% स्कोर करने वाला एक स्व-विकासशील MoE मॉडल है
2026-02-10 Step 3.5 Flash 51.0% चरण 3.5 फ्लैश: खुला 11B-सक्रिय MoE मॉडल अग्रणी स्तर की एजेंटिक प्रदर्शन प्राप्त करता है
2025-11-19 GPT-5.1-Codex-Max 58.1% OpenAI ने Codex CLI में GPT-5.1-Codex-Max को डिफ़ॉल्ट बना दिया