Benchmark · agentic

WebArena

9 परिणाम 9 मॉडल

WebArena यह परखता है कि कोई स्वायत्त web एजेंट वास्तविक, कई-चरणों वाले कार्य यथार्थवादी, स्वयं-होस्ट की गई वेबसाइटों के एक समूह — ऑनलाइन शॉपिंग, एक फ़ोरम और एक कंटेंट-मैनेजमेंट सिस्टम (CMS) — पर पूरा कर सकता है या नहीं। इसका माप है task success rate: उन कार्यों का प्रतिशत जिन्हें एजेंट सही ढंग से पूरा करता है।

और पढ़ें
उदाहरण
एक प्रतिनिधि कार्य: «किसी श्रेणी में सबसे सस्ता उत्पाद ढूँढो और उसकी दो इकाइयाँ कार्ट में डालो» — एजेंट को यह लक्ष्य असली साइट पर ब्राउज़ करते, क्लिक करते और टाइप करते हुए हासिल करना होता है।
स्कोरिंग
माप है task success rate: पूरे किए गए कार्यों को कुल कार्यों से भाग देकर, प्रतिशत के रूप में।
सत्यापन
हर कार्य के साथ एक प्रोग्रामेटिक चेकर आता है जो परिणाम को स्वतः सत्यापित करता है — या तो अपेक्षित उत्तर से मिलान करके, या वेबसाइट की अंतिम स्थिति की जाँच करके — इसलिए मूल्यांकन मशीन करती है, इंसान नहीं।
यह क्यों मायने रखता है
यह दिखाता है कि क्या LLM एजेंट सचमुच असली वेबसाइटों को शुरू से अंत तक चला सकते हैं — यह एकल-चरण या कृत्रिम web कार्यों से कहीं कठिन और व्यावहारिक परीक्षा है — जिससे यह एजेंटिक web ऑटोमेशन का एक अहम मापदंड बन जाता है।
हल किया गया उदाहरण
कार्य
आप WebArena के सेल्फ-होस्टेड GitLab परिवेश में एक स्वायत्त वेब एजेंट हैं: आप पेज की accessibility tree देखते हैं और हर चरण में WebArena के ऐक्शन-स्पेस से एक क्रिया देते हैं (जैसे click [id], type [id] [text] [enter], goto [url], stop [answer])। लक्ष्य: a11yproject/a11yproject.com रिपॉज़िटरी में Bug: login button unresponsive शीर्षक वाला एक नया issue बनाएँ और उसे स्वयं को असाइन करें।
समाधान
goto [http://gitlab.webarena/a11yproject/a11yproject.com/-/issues/new]
type [1023] [Bug: login button unresponsive] [0]
click [1187]        # open the Assignee dropdown
click [1203]        # choose "Assign to me"
click [1250]        # click the "Create issue" button
stop [N/A]
व्याख्या
यह ट्रैजेक्टरी नया issue फ़ॉर्म खोलती है, सटीक शीर्षक टाइप करती है, असाइनी मेनू से इसे स्वयं को असाइन करती है और सबमिट करती है; चूँकि कार्य कोई मान लौटाने के बजाय स्थिति (state) बदलता है, इसलिए stop [N/A] एपिसोड समाप्त करता है। WebArena का program_html मूल्यांकनकर्ता बनाए गए issue को फिर से लोड करके DOM की कार्यात्मक जाँच करता है — शीर्षक दी गई स्ट्रिंग के बराबर और असाइनी लॉग-इन उपयोगकर्ता के बराबर — इसलिए लगभग-सही परिणाम को 0 अंक मिलते हैं।
0 19.5 39 58.5 78 2023-07-25 2025-01-26 2026-07-31 GPT-4-based agent · 14.4 · 2023-07-25 SteP · 33.5 · 2023-10-05 AWA 1.5 · 57.1 · 2024-08-08 AgentOccam · 9.8 · 2024-10-17 CUA · 58.1 · 2025-01-23 Surfer 2 · 69.6 · 2025-10-22 ColorBrowserAgent · 71.2 · 2026-01-12 GUI-Owl-1.5 · 48.4 · 2026-02-24 Qwen-UI-Agent · 73.6 · 2026-07-31
GPT-4-based agent SteP AWA 1.5 AgentOccam CUA Surfer 2 ColorBrowserAgent GUI-Owl-1.5 Qwen-UI-Agent
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-31 Qwen-UI-Agent 73.6% Qwen-UI-Agent मोबाइल-यूज़ बेंचमार्क्स पर स्टेट ऑफ़ द आर्ट स्थापित करता है
2026-02-24 GUI-Owl-1.5 48.4% GUI-Owl-1.5 बहु-प्लेटफ़ॉर्म मौलिक GUI एजेंट्स को पेश करता है
2026-01-12 ColorBrowserAgent 71.2% ColorBrowserAgent मजबूत दीर्घकालिक वेब स्वचालन के लिए अनुकूलित ज्ञान विकास पेश करता है
2025-10-22 Surfer 2 69.6% Surfer 2 दृश्य अवलोकन के माध्यम से क्रॉस-प्लेटफ़ॉर्म कंप्यूटर उपयोग में राज्य-कला प्राप्त करता है
2025-01-23 CUA 58.1% OpenAI ने कंप्यूटर-यूजिंग एजेंट (CUA) द्वारा संचालित ऑपरेटर शोध पूर्वावलोकन का परिचय दिया
2024-10-17 AgentOccam 9.8% AgentOccam अवलोकन और क्रिया स्थानों को संरेखित करके LLM वेब एजेंट के प्रदर्शन को बढ़ाता है
2024-08-08 AWA 1.5 57.14% WebArena बेंचमार्क पर AWA 1.5 ने 57.14% हासिल किया
2023-10-05 SteP 33.5% SteP वेब कार्य प्रदर्शन में सुधार के लिए स्टैक्ड LLM नीतियों का उपयोग करता है
2023-07-25 GPT-4-based agent 14.41% WebArena: स्वतंत्र एजेंट्स के लिए यथार्थवादी वेब वातावरण