Benchmark · agentic

Terminal-Bench 2

40 نتائج 31 نماذج

Harbor/Terminus-2 89-task terminal-agent suite; 2.0 and 2.1 are the same task set, so one series. File here only when the quote says 2.0 / 2.1 / v2 — not the original suite (terminal-bench), and not the harder 'Terminal-Bench Hard' subset (not in this catalog).

0 25 50 75 100 2025-11-19 2026-04-15 2026-09-10 GPT-5.1-Codex-Max · 58.1 · 2025-11-19 Step 3.5 Flash · 51 · 2026-02-10 MiniMax M2.7 · 57 · 2026-04-12 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-25 Qwen3.6-27B · 59.3 · 2026-04-25 Qwen3.6-27B · 60.7 · 2026-08-10 GLM 5.2 FP8 with FP8 KV · 79.8 · 2026-07-05 LLM-as-a-Verifier · 86.5 · 2026-07-07 Grok 4.5 · 83.3 · 2026-07-08 hermes · 55 · 2026-07-08 Gemini 3.5 Flash-Lite · 54 · 2026-07-21 Gemini 3.5 Flash-Lite · 54 · 2026-07-21 Gemini 3.5 Flash-Lite · 54 · 2026-07-27 KAT-Coder-V2.5 · 60.7 · 2026-07-26 DeepSeek-V4-Flash · 82.7 · 2026-07-31 DeepSeek-V4-Flash · 79 · 2026-08-01 DeepSeek-V4-Flash-0731 · 82.7 · 2026-07-31 DeepSeek-V4-Flash-0731 · 82.7 · 2026-08-07 V4 Flash 0731 · 79 · 2026-08-01 Inkling-Small · 64.7 · 2026-08-03 Qwen3.8-Max · 86.6 · 2026-08-03 Qwen3.8-Max · 67.4 · 2026-08-05 Muse Spark 1.1 · 80 · 2026-08-05 Pokee-Isaac 28B · 65.1 · 2026-08-08 DeepSeek V4 Flash 0731 · 82.7 · 2026-08-09 Opus 5 · 86.7 · 2026-08-11 Grok 4.6 · 88.4 · 2026-08-13 Grok 4.6 · 88.4 · 2026-08-21 DeepSeek-V4-Pro · 87.9 · 2026-08-13 Ornith-1.5 · 86.1 · 2026-08-19 agents · 94 · 2026-08-20 DeepSeek-V4-Flash-Vision-Exp · 83.9 · 2026-08-21 Granite 4.2 30B · 29.2 · 2026-08-26 Granite 4.2 8B · 20.6 · 2026-08-26 Muse Spark 1.3 · 88.8 · 2026-09-04 K2-Horizon-MoVA-36B-A4B · 58.6 · 2026-09-07 K2-Horizon-375B-A23B · 66.9 · 2026-09-07 DeepSeek-V4.1-Flash · 90.6 · 2026-09-10
GPT-5.1-Codex-Max Step 3.5 Flash MiniMax M2.7 GPT-5.5 Qwen3.6-27B GLM 5.2 FP8 with FP8 KV LLM-as-a-Verifier Grok 4.5 hermes Gemini 3.5 Flash-Lite KAT-Coder-V2.5 DeepSeek-V4-Flash DeepSeek-V4-Flash-0731 V4 Flash 0731 Inkling-Small Qwen3.8-Max Muse Spark 1.1 Pokee-Isaac 28B DeepSeek V4 Flash 0731 Opus 5 Grok 4.6 DeepSeek-V4-Pro Ornith-1.5 agents DeepSeek-V4-Flash-Vision-Exp Granite 4.2 30B Granite 4.2 8B Muse Spark 1.3 K2-Horizon-MoVA-36B-A4B K2-Horizon-375B-A23B DeepSeek-V4.1-Flash
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-09-10 DeepSeek-V4.1-Flash 90.6% ديب سيك تطلق نموذج V4.1-Flash بدعم متعدد الوسائط الأصلي
2026-09-07 K2-Horizon-MoVA-36B-A4B 58.6% IFM تُصدر K2 Horizon: ستة نماذج Apache 2.0 من 0.9B إلى 375B
2026-09-07 K2-Horizon-375B-A23B 66.9% IFM تُصدر K2 Horizon: ستة نماذج Apache 2.0 من 0.9B إلى 375B
2026-09-04 Muse Spark 1.3 88.8% Meta تطلق Muse Spark 1.3 بمكالمات أدوات ورموز أقل
2026-08-26 Granite 4.2 30B 29.24% إصدار غرانيت 4.2 من آي بي إم مع الاستدلال الأصلي والتعلم المعزز الوكيل للنماذج المؤسسية المفتوحة
2026-08-26 Granite 4.2 8B 20.56% إصدار غرانيت 4.2 من آي بي إم مع الاستدلال الأصلي والتعلم المعزز الوكيل للنماذج المؤسسية المفتوحة
2026-08-21 Grok 4.6 88.4% SpaceXAI تطرح غروك 4.6 ببيانات كورسر للأعمال الوكيلية
2026-08-21 DeepSeek-V4-Flash-Vision-Exp 83.9% ديب سيك تطلق النموذج متعدد الوسائط DeepSeek-V4-Flash-Vision-Exp
2026-08-20 agents 94.0% إطلاق ميتا لموديل ميوز فيديو مع صوت أصلي؛ سترايب تستحوذ على أوبن رويتر
2026-08-19 Ornith-1.5 86.1% إطلاق Ornith-1.5 لنماذج بحجم 9B و35B-A3B و397B بتدريب ذاتي التحسين
2026-08-13 DeepSeek-V4-Pro 87.9% إصدار DeepSeek-V4-Pro العام يعزز قدرات الوكيل ويضيف دعم API الاستجابات
2026-08-13 Grok 4.6 88.4% xAI تطلق Grok 4.6؛ أليباबा تفتح Qwen3.8-MoE؛ DeepSeek V4 GA
2026-08-11 Opus 5 86.74% وكيل Ouroboros ذاتي التطوير يضرب أرقامًا قياسية جديدة مع Opus 5
2026-08-10 Qwen3.6-27B 60.7% إطلاق ميتا لـ Muse Glimmer، نموذج وكيل بوزن مفتوح يتكون من 30 مليار معلمة ويعمل على بطاقة رسوميات استهلاكية واحدة
2026-08-09 DeepSeek V4 Flash 0731 82.7% DeepSeek V4 Flash 0731 يحقق 82.7% على Terminal-Bench 2.1 في بيئة عامة
2026-08-08 Pokee-Isaac 28B 65.1% Pokee AI تطلق Pokee-Isaac 28B، نموذج سياق بـ 10 ملايين رمز للنشر ضمن الحدود المحددة
2026-08-07 DeepSeek-V4-Flash-0731 82.7% ديب سيك تطلق V4-Flash-0731، متفوقة على V4-Pro بتكلفة أقل
2026-08-05 Muse Spark 1.1 80.0% إطلاق ميتا لإصدار تجريبي من وكيل سطر الأوامر "ميوز كود" المدعوم بنموذج "ميوز سبارك 1.2"
2026-08-05 Qwen3.8-Max 67.4% أليبابا تعلن عن Qwen3.8-Max بـ 2.4T معلمة وأوزان مفتوحة قادمة
2026-08-03 Qwen3.8-Max 86.6% أليبايبا تطلق Qwen3.8-Max، نموذج MoE بـ 2.4 تريليون معلمة
2026-08-03 Inkling-Small 64.7% مختبر الآلات المفكرة يُصدر Inkling-Small، وهو نموذج MoE متعدد الوسائط بوزن مفتوح يتكون من 276 مليار معلمة
2026-08-01 V4 Flash 0731 79.0% ديب سيك تطلق V4-Flash بتحسينات كبيرة ما بعد التدريب وأوزان مفتوحة المصدر
2026-08-01 DeepSeek-V4-Flash 79.0% ديب سيك تطلق V4-Flash بتحسينات ما بعد التدريب وأوزان مفتوحة
2026-07-31 DeepSeek-V4-Flash-0731 82.7% DeepSeek تطلق V4-Flash-0731 بتحسينات كبيرة في المهام الوكيلية بتكلفة أقل
2026-07-31 DeepSeek-V4-Flash 82.7% ديب سيك تطلق النسخة التجريبية العامة من DeepSeek-V4-Flash بقدرات وكيل محسّنة
2026-07-27 Gemini 3.5 Flash-Lite 54.0% جوجل تطلق Gemini 3.6 Flash و3.5 Flash-Lite و3.5 Flash Cyber
2026-07-26 KAT-Coder-V2.5 60.7% كواي كات تُصدر KAT-Coder-V2.5، نموذج برمجة وكيلي تم تدريبه على أكثر من 100,000 بيئة قابلة للتحقق
2026-07-21 Gemini 3.5 Flash-Lite 54.0% جوجل تطلق نماذج جيميناي 3.6 فلاش، و3.5 فلاش-لايت، و3.5 فلاش سايبير لأعباء العمل الوكيلية
2026-07-21 Gemini 3.5 Flash-Lite 54.0% جوجل تطلق جيميني 3.6 فلاش، و3.5 فلاش-لايت، و3.5 فلاش سايبير
2026-07-08 hermes 55.0% مقاييس المستخدم لـ Mimo v2.5 ضد DeepSeek V4 Flash و Hermes
2026-07-08 Grok 4.5 83.3% إكس آي تطلق غروك 4.5 بتكلفة منخفضة وأداء مختلط في الاختبارات المرجعية
2026-07-07 LLM-as-a-Verifier 86.5% LLM-as-a-Verifier يقدم إطار عمل تحقق عام مع تقييم مستمر
2026-07-05 GLM 5.2 FP8 with FP8 KV 79.8% GLM 5.2 FP8 مع KV FP8 يحقق 79.8% على Terminal-Bench 2.1
2026-04-25 Qwen3.6-27B 59.3% أليبا تطلق Qwen3.6-27B، متفوقةً على سلفها الأكبر في معايير الترميز
2026-04-25 GPT-5.5 82.7% OpenAI تطلق GPT-5.5، نموذج مُعاد تدريبه من الصفر مع معالجة أومني مودال أصلية
2026-04-23 GPT-5.5 82.7% OpenAI تطلق GPT-5.5 بقدرات وكيلية ومضاعفة أسعار واجهة برمجة التطبيقات
2026-04-23 GPT-5.5 82.7% OpenAI تطلق GPT-5.5 وGPT-5.5 Pro عبر واجهة برمجة التطبيقات
2026-04-12 MiniMax M2.7 57.0% MiniMax تطلق M2.7 كمصدر مفتوح، نموذج MoE يتطور ذاتياً بحصوله على 56.22% في SWE-Pro
2026-02-10 Step 3.5 Flash 51.0% الخطوة 3.5 فلاش: نموذج MoE النشط بـ 11 مليار معلمة يحقق أداءً وكيلاً على المستوى المتقدم
2025-11-19 GPT-5.1-Codex-Max 58.1% OpenAI تجعل GPT-5.1-Codex-Max الافتراضي في Codex CLI