Benchmark · agentic
AgentBench
يقيّم AgentBench نماذج LLM بوصفها وكلاء تفاعليين عبر 8 بيئات مختلفة (مهام برمجية وألعاب وويب)، ويقيس اتخاذ القرار عبر جولات متعددة؛ تُنتج كل بيئة درجتها الخاصة، ثم تُجمع في درجة إجمالية مرجَّحة واحدة Overall Score.
اقرأ المزيد
- مثال
- مهمة بيئة «نظام التشغيل»: يُعطى الوكيل هدفًا بلغة طبيعية (مثل عدّ الملفات التي تحقق شرطًا ما، أو تغيير أذونات ملف)، فيُدخل أوامر bash جولةً بعد جولة، ويقرأ كل مخرجات، ثم يرسل إجابة نهائية أو يترك الـ shell في الحالة المطلوبة.
- طريقة التقييم
- تستخدم كل بيئة مقياسها الخاص: معدل النجاح (OS وDB وHouse-Holding)، وF1 (رسم المعرفة)، ومتوسط المكافأة (Web Shopping)، ودقة الخطوة/العنصر (تصفح الويب)، أو تقدّم اللعبة/مكافأتها (لعبة الورق والألغاز). أما الدرجة الرئيسية Overall Score فهي متوسط مرجَّح للدرجات الثماني، وتُختار الأوزان لموازنة الصعوبة كي لا تهيمن مهمة سهلة واحدة.
- التحقق
- تعمل كل مهمة في بيئة قابلة للتنفيذ مع مدقِّق آلي حتمي: يُتحقق من مسار الوكيل متعدد الجولات برمجيًا (مثل سكربت فحص للـ shell، أو الحالة النهائية لقاعدة البيانات، أو مكافأة WebShop، أو المطابقة مع الأفعال المرجعية). لا يوجد تحكيم بشري؛ وللتفاعلات حد أقصى من الجولات، وتجاوز الحد أو إصدار فعل غير صالح يُحتسب فشلًا.
- لماذا يهم
- كان من أوائل المعايير القياسية التي تختبر نماذج LLM بوصفها وكلاء لا مجرد مجيبين بجولة واحدة، إذ يمرّن الاستدلال طويل المدى واستخدام الأدوات والتعافي من الأخطاء؛ وقد كشف فجوة واسعة بين أفضل النماذج التجارية عبر واجهات API والنماذج مفتوحة المصدر في المهام الوكيلية الحقيقية.
مثال محلول
المهمة
بيئة «نظام التشغيل». في shell من نوع bash على Ubuntu، يُقال للوكيل: «كم عدد حسابات المستخدمين في هذا النظام التي تستخدم /bin/bash بوصفه shell تسجيل الدخول؟ اذكر العدد.» ويمكنه تنفيذ عدة أوامر shell عبر جولات متعددة قبل الإجابة.
الحل
grep -c ':/bin/bash$' /etc/passwd
الشرح
الحقل السابع (المفصول بنقطتين) في كل سطر من /etc/passwd هو shell تسجيل الدخول، لذا فإن عدّ الأسطر المنتهية بـ :/bin/bash يعطي عدد حسابات bash؛ يقرأ الوكيل هذا العدد من مخرجات الأمر ويعيده عبر فعل البيئة
answer(N). التقييم: يشغّل مدقِّق OS سكربت تحقق ويمنح التسليم درجة نجاح/فشل ثنائية.لا توجد درجات موثّقة لهذا الـ Benchmark بعد.