Benchmark · agentic
WebArena
يختبر WebArena ما إذا كان بإمكان وكيل web مستقل إنجاز مهام حقيقية متعددة الخطوات على مجموعة من المواقع الواقعية المستضافة ذاتيًا — تسوّق إلكتروني، ومنتدى، ونظام إدارة محتوى (CMS). مقياسه هو task success rate (معدل نجاح المهام): النسبة المئوية للمهام التي يكملها الوكيل بشكل صحيح.
اقرأ المزيد
- مثال
- مثال على مهمة نموذجية: «ابحث عن أرخص منتج في فئة معيّنة وأضِف قطعتين منه إلى السلة»، وعلى الوكيل تحقيق الهدف عبر التصفّح والنقر والكتابة داخل الموقع الحقيقي.
- طريقة التقييم
- المقياس هو معدل نجاح المهام: عدد المهام المنجزة مقسومًا على إجمالي عدد المهام، معبَّرًا عنه كنسبة مئوية.
- التحقق
- تأتي كل مهمة مع مدقّق برمجي يتحقق من النتيجة تلقائيًا — إمّا بمطابقة الإجابة المتوقعة أو بفحص الحالة النهائية للموقع — بحيث يتم التقييم آليًا لا بشريًا.
- لماذا يهم
- يبيّن ما إذا كانت وكلاء LLM قادرة فعلًا على تشغيل مواقع web حقيقية من البداية إلى النهاية — وهو اختبار أصعب وأكثر عملية من مهام web أحادية الخطوة أو الاصطناعية — ما يجعله معيارًا أساسيًا لأتمتة web القائمة على الوكلاء.
مثال محلول
المهمة
أنت وكيل ويب مستقل في بيئة GitLab المستضافة ذاتيًا ضمن WebArena: تراقب شجرة الوصول (accessibility tree) للصفحة وتُصدر في كل خطوة إجراءً واحدًا من فضاء إجراءات WebArena (مثل
click [id] وtype [id] [text] [enter] وgoto [url] وstop [answer]). الهدف: أنشئ issue جديدة بعنوان Bug: login button unresponsive في مستودع a11yproject/a11yproject.com وأسندها إلى نفسك.الحل
goto [http://gitlab.webarena/a11yproject/a11yproject.com/-/issues/new]
type [1023] [Bug: login button unresponsive] [0]
click [1187] # open the Assignee dropdown
click [1203] # choose "Assign to me"
click [1250] # click the "Create issue" button
stop [N/A]
الشرح
يفتح المسار نموذج issue الجديدة، ويكتب العنوان الدقيق، ويُسند المهمة إلى نفسه عبر قائمة المُكلَّف، ثم يرسل النموذج؛ وينهي
stop [N/A] الحلقة لأن المهمة تُغيّر الحالة بدلًا من إرجاع قيمة. يعيد مُقيّم program_html في WebArena تحميل الـ issue المُنشأة ويفحص الـ DOM وظيفيًا — العنوان يساوي السلسلة والمُكلَّف يساوي المستخدم المسجَّل دخوله — لذا تحصل النتائج شبه الصحيحة على 0.| التاريخ | النموذج | النتيجة | المصدر |
|---|---|---|---|
| 2026-07-31 | Qwen-UI-Agent | 73.6% | يُحدّد Qwen-UI-Agent حالة الفن في معايير استخدام الهاتف المحمول |
| 2026-02-24 | GUI-Owl-1.5 | 48.4% | GUI-Owl-1.5 يقدم وكلاء واجهة مستخدم رسومية أساسية عبر منصات متعددة |
| 2026-01-12 | ColorBrowserAgent | 71.2% | ColorBrowserAgent يقدم تطور المعرفة التكيفي لأتمتة الويب طويلة المدى القوية |
| 2025-10-22 | Surfer 2 | 69.6% | Surfer 2 يحقق استخدامًا للكمبيوتر عبر المنصات بأعلى مستوى من الأداء عبر الملاحظة البصرية |
| 2025-01-23 | CUA | 58.1% | OpenAI تقدم وكيل استخدام الحاسوب (CUA) الذي يدعم البحث التجريبي لـ Operator |
| 2024-10-17 | AgentOccam | 9.8% | يقوم AgentOccam بمحاذاة مساحتي الملاحظة والإجراء لتعزيز أداء وكلاء الويب المعتمدين على LLM |
| 2024-08-08 | AWA 1.5 | 57.14% | AWA 1.5 يحقق 57.14% في معيار WebArena |
| 2023-10-05 | SteP | 33.5% | يستخدم SteP سياسات LLM متراكمة لتحسين أداء المهام الويب |
| 2023-07-25 | GPT-4-based agent | 14.41% | WebArena: بيئة ويب واقعية للوكلاء المستقلين |