Benchmark · agentic

Terminal-Bench

27 نتائج 17 نماذج

يقيس Terminal-Bench مدى قدرة وكلاء الذكاء الاصطناعي على إنجاز مهام سطر الأوامر الحقيقية داخل الطرفية (terminal)، مثل تثبيت البرامج وتصحيح الأخطاء وعمليات النظام. الدرجة هي النسبة المئوية للمهام التي يكملها الوكيل بنجاح.

اقرأ المزيد
مثال
المهمة النموذجية تمنح الوكيل بيئة معطوبة أو فارغة وتطلب منه الوصول بها إلى حالة عاملة — مثل تثبيت التبعيات (dependencies) الصحيحة وإصلاح الإعدادات كي يعمل برنامج ما، وكل ذلك عبر أوامر الطرفية.
طريقة التقييم
تُقيَّم كل مهمة بنجاح أو فشل بناءً على ما إذا كان الوكيل قد بلغ الحالة النهائية المطلوبة، ودرجة المعيار هي النسبة المئوية للمهام المحلولة من إجماليها.
التحقق
لا تُقبل النتيجة إلا إذا أكدت فحوص آلية داخل بيئة معزولة (sandbox) أن الهدف المقصود من المهمة قد تحقق — وليس عبر تصويت بشري أو مطابقة نصية دقيقة.
لماذا يهم
مهارات الطرفية — التثبيت وتصحيح الأخطاء وتشغيل الأنظمة من سطر الأوامر — أساسية في العمل الهندسي الحقيقي، لذا يُظهر هذا المعيار ما إذا كان الوكيل قادرًا على التصرف باستقلالية وموثوقية في سطر أوامر حقيقي. كما أن نسخته 2.x الأصعب ترفع سقف التحدي كلما تحسّن الوكلاء.
مثال محلول
المهمة
داخل حاوية Docker الخاصة بـ Terminal-Bench، يحتوي الملف /app/access.log على سجلات وصول Apache. اكتب أمرًا واحدًا يحسب عدد عناوين IP المختلفة للعملاء (الحقل الأول المفصول بمسافات في كل سطر) ويحفظ ذلك العدد فقط في /app/answer.txt.
الحل
awk '{print $1}' /app/access.log | sort -u | wc -l > /app/answer.txt
الشرح
يطبع awk الحقل الأول (عنوان IP للعميل) من كل سطر في السجل، ويزيل sort -u التكرارات، ويحسب wc -l عناوين IP الفريدة المتبقية، مع إعادة توجيه النتيجة إلى /app/answer.txt. يقيّم Terminal-Bench الحل بتشغيل اختبار pytest داخل الحاوية يقرأ /app/answer.txt ويتحقق من مساواته لعدد عناوين IP الفريدة المعروف.
0 24.5 49 73.5 98 2025-05-22 2025-12-24 2026-07-29 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-23 Claude Sonnet 4 · 35.5 · 2025-05-23 GLM-4.6 · 40.5 · 2025-09-30 Claude Sonnet 4.5 · 50 · 2025-09-30 Claude Opus 4.5 · 59.3 · 2025-11-25 Claude Opus 4.6 · 65.4 · 2026-02-05 Composer 2 · 61.7 · 2026-03-27 GPT-5.6 Sol (ultra mode) · 91.9 · 2026-06-26 GPT-5.6 Sol · 88.8 · 2026-06-26 GLM-5.2 (753B MoE) · 70.8 · 2026-07-08 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 Kimi K2.6 · 73 · 2026-07-29 GPT-5.5 · 69 · 2026-07-29 Kimi K3 · 32 · 2026-07-29
Claude Opus 4 Claude Sonnet 4 GLM-4.6 Claude Sonnet 4.5 Claude Opus 4.5 Claude Opus 4.6 Composer 2 GPT-5.6 Sol (ultra mode) GPT-5.6 Sol GLM-5.2 (753B MoE) RELAI-VCL Meta Harness GEPA baseline agent Kimi K2.6 GPT-5.5 Kimi K3
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-07-29 Kimi K2.6 73.0% Fireworks AI تطلق طبقة توجيه Fireworks Nexus للتحكم في التكاليف
2026-07-29 GPT-5.5 69.0% Fireworks AI تطلق طبقة توجيه Fireworks Nexus للتحكم في التكاليف
2026-07-29 Kimi K3 32.0% Fireworks AI تطلق طبقة توجيه Fireworks Nexus للتحكم في التكاليف
2026-07-16 baseline agent 58.7% تحسين المركبات بواسطة RELAI-VCL يحقق مكاسب على Terminal-Bench 2.0
2026-07-16 Meta Harness 64.6% تحسين المركبات بواسطة RELAI-VCL يحقق مكاسب على Terminal-Bench 2.0
2026-07-16 GEPA 66.0% تحسين المركبات بواسطة RELAI-VCL يحقق مكاسب على Terminal-Bench 2.0
2026-07-16 RELAI-VCL 76.4% تحسين المركبات بواسطة RELAI-VCL يحقق مكاسب على Terminal-Bench 2.0
2026-07-16 Meta Harness 64.6% تُضاعف RELAI-VCL مكاسب الوكيل-المُحسّن عبر التعلم المستمر
2026-07-16 RELAI-VCL 76.4% تُضاعف RELAI-VCL مكاسب الوكيل-المُحسّن عبر التعلم المستمر
2026-07-16 GEPA 66.0% تُضاعف RELAI-VCL مكاسب الوكيل-المُحسّن عبر التعلم المستمر
2026-07-16 baseline agent 58.7% تُضاعف RELAI-VCL مكاسب الوكيل-المُحسّن عبر التعلم المستمر
2026-07-16 RELAI-VCL 76.4% تضاعف RELAI-VCL مكاسب تحسين الوكيل عبر التعلم المستمر
2026-07-16 Meta Harness 64.6% تضاعف RELAI-VCL مكاسب تحسين الوكيل عبر التعلم المستمر
2026-07-16 GEPA 66.0% تضاعف RELAI-VCL مكاسب تحسين الوكيل عبر التعلم المستمر
2026-07-16 baseline agent 58.7% تضاعف RELAI-VCL مكاسب تحسين الوكيل عبر التعلم المستمر
2026-07-08 GLM-5.2 (753B MoE) 70.8% GLM-5.2 بـ 4 بت على 4× DGX Spark يحقق 70.8% على Terminal-Bench 2.1
2026-06-26 GPT-5.6 Sol (ultra mode) 91.9% أوبن إيه آي تطرح GPT-5.6 Sol بشكل تجريبي بسجل في البرمجة لكنها تعترف بمشاكل الغش
2026-06-26 GPT-5.6 Sol 88.8% أوبن إيه آي تطرح GPT-5.6 Sol بشكل تجريبي بسجل في البرمجة لكنها تعترف بمشاكل الغش
2026-03-27 Composer 2 61.7pts Cursor تنشر التقرير التقني حول تدريب نموذج البرمجة الوكيلية Composer 2
2026-02-05 Claude Opus 4.6 65.4% أنثروبيك تطلق كلاود أوبوس 4.6 بنافذة سياق بـ 1 مليون وتطبيقات عميلية محسّنة
2025-11-25 Claude Opus 4.5 59.3% أنثروبيك تطلق كلاود أوبوس 4.5 بأحدث تقنيات البرمجة واستخدام الحاسوب
2025-09-30 GLM-4.6 40.5% Zhipu AI تطلق GLM-4.6 بقدرات وكيل ونافذة سياق بحجم 128k
2025-09-30 Claude Sonnet 4.5 50.0% أنثروبيك تطلق كلود سونيت 4.5 بقدرات برمجة ووكيل محسّنة
2025-05-23 Claude Sonnet 4 35.5% أنثروبيك تطلق كلاود أوبس 4 وسونيت 4 بقدرة التفكير الهجين
2025-05-23 Claude Opus 4 43.2% أنثروبيك تطلق كلاود أوبس 4 وسونيت 4 بقدرة التفكير الهجين
2025-05-22 Claude Opus 4 43.2% أنثروبيك تطرح كلاود أوبس 4 وسونيت 4 مع التفكير الممتد واستخدام الأدوات
2025-05-22 Claude Opus 4 43.2% أنثروبيك تطلق كلاود أوبس 4 وسونيت 4 بتدابير سلامة ASL-3