Benchmark · agentic

WebArena

9 نتائج 9 نماذج

يختبر WebArena ما إذا كان بإمكان وكيل web مستقل إنجاز مهام حقيقية متعددة الخطوات على مجموعة من المواقع الواقعية المستضافة ذاتيًا — تسوّق إلكتروني، ومنتدى، ونظام إدارة محتوى (CMS). مقياسه هو task success rate (معدل نجاح المهام): النسبة المئوية للمهام التي يكملها الوكيل بشكل صحيح.

اقرأ المزيد
مثال
مثال على مهمة نموذجية: «ابحث عن أرخص منتج في فئة معيّنة وأضِف قطعتين منه إلى السلة»، وعلى الوكيل تحقيق الهدف عبر التصفّح والنقر والكتابة داخل الموقع الحقيقي.
طريقة التقييم
المقياس هو معدل نجاح المهام: عدد المهام المنجزة مقسومًا على إجمالي عدد المهام، معبَّرًا عنه كنسبة مئوية.
التحقق
تأتي كل مهمة مع مدقّق برمجي يتحقق من النتيجة تلقائيًا — إمّا بمطابقة الإجابة المتوقعة أو بفحص الحالة النهائية للموقع — بحيث يتم التقييم آليًا لا بشريًا.
لماذا يهم
يبيّن ما إذا كانت وكلاء LLM قادرة فعلًا على تشغيل مواقع web حقيقية من البداية إلى النهاية — وهو اختبار أصعب وأكثر عملية من مهام web أحادية الخطوة أو الاصطناعية — ما يجعله معيارًا أساسيًا لأتمتة web القائمة على الوكلاء.
مثال محلول
المهمة
أنت وكيل ويب مستقل في بيئة GitLab المستضافة ذاتيًا ضمن WebArena: تراقب شجرة الوصول (accessibility tree) للصفحة وتُصدر في كل خطوة إجراءً واحدًا من فضاء إجراءات WebArena (مثل click [id] وtype [id] [text] [enter] وgoto [url] وstop [answer]). الهدف: أنشئ issue جديدة بعنوان Bug: login button unresponsive في مستودع a11yproject/a11yproject.com وأسندها إلى نفسك.
الحل
goto [http://gitlab.webarena/a11yproject/a11yproject.com/-/issues/new]
type [1023] [Bug: login button unresponsive] [0]
click [1187]        # open the Assignee dropdown
click [1203]        # choose "Assign to me"
click [1250]        # click the "Create issue" button
stop [N/A]
الشرح
يفتح المسار نموذج issue الجديدة، ويكتب العنوان الدقيق، ويُسند المهمة إلى نفسه عبر قائمة المُكلَّف، ثم يرسل النموذج؛ وينهي stop [N/A] الحلقة لأن المهمة تُغيّر الحالة بدلًا من إرجاع قيمة. يعيد مُقيّم program_html في WebArena تحميل الـ issue المُنشأة ويفحص الـ DOM وظيفيًا — العنوان يساوي السلسلة والمُكلَّف يساوي المستخدم المسجَّل دخوله — لذا تحصل النتائج شبه الصحيحة على 0.
0 19.5 39 58.5 78 2023-07-25 2025-01-26 2026-07-31 GPT-4-based agent · 14.4 · 2023-07-25 SteP · 33.5 · 2023-10-05 AWA 1.5 · 57.1 · 2024-08-08 AgentOccam · 9.8 · 2024-10-17 CUA · 58.1 · 2025-01-23 Surfer 2 · 69.6 · 2025-10-22 ColorBrowserAgent · 71.2 · 2026-01-12 GUI-Owl-1.5 · 48.4 · 2026-02-24 Qwen-UI-Agent · 73.6 · 2026-07-31
GPT-4-based agent SteP AWA 1.5 AgentOccam CUA Surfer 2 ColorBrowserAgent GUI-Owl-1.5 Qwen-UI-Agent
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-07-31 Qwen-UI-Agent 73.6% يُحدّد Qwen-UI-Agent حالة الفن في معايير استخدام الهاتف المحمول
2026-02-24 GUI-Owl-1.5 48.4% GUI-Owl-1.5 يقدم وكلاء واجهة مستخدم رسومية أساسية عبر منصات متعددة
2026-01-12 ColorBrowserAgent 71.2% ColorBrowserAgent يقدم تطور المعرفة التكيفي لأتمتة الويب طويلة المدى القوية
2025-10-22 Surfer 2 69.6% Surfer 2 يحقق استخدامًا للكمبيوتر عبر المنصات بأعلى مستوى من الأداء عبر الملاحظة البصرية
2025-01-23 CUA 58.1% OpenAI تقدم وكيل استخدام الحاسوب (CUA) الذي يدعم البحث التجريبي لـ Operator
2024-10-17 AgentOccam 9.8% يقوم AgentOccam بمحاذاة مساحتي الملاحظة والإجراء لتعزيز أداء وكلاء الويب المعتمدين على LLM
2024-08-08 AWA 1.5 57.14% AWA 1.5 يحقق 57.14% في معيار WebArena
2023-10-05 SteP 33.5% يستخدم SteP سياسات LLM متراكمة لتحسين أداء المهام الويب
2023-07-25 GPT-4-based agent 14.41% WebArena: بيئة ويب واقعية للوكلاء المستقلين