Benchmark · agentic
WebArena
WebArena यह परखता है कि कोई स्वायत्त web एजेंट वास्तविक, कई-चरणों वाले कार्य यथार्थवादी, स्वयं-होस्ट की गई वेबसाइटों के एक समूह — ऑनलाइन शॉपिंग, एक फ़ोरम और एक कंटेंट-मैनेजमेंट सिस्टम (CMS) — पर पूरा कर सकता है या नहीं। इसका माप है task success rate: उन कार्यों का प्रतिशत जिन्हें एजेंट सही ढंग से पूरा करता है।
और पढ़ें
- उदाहरण
- एक प्रतिनिधि कार्य: «किसी श्रेणी में सबसे सस्ता उत्पाद ढूँढो और उसकी दो इकाइयाँ कार्ट में डालो» — एजेंट को यह लक्ष्य असली साइट पर ब्राउज़ करते, क्लिक करते और टाइप करते हुए हासिल करना होता है।
- स्कोरिंग
- माप है task success rate: पूरे किए गए कार्यों को कुल कार्यों से भाग देकर, प्रतिशत के रूप में।
- सत्यापन
- हर कार्य के साथ एक प्रोग्रामेटिक चेकर आता है जो परिणाम को स्वतः सत्यापित करता है — या तो अपेक्षित उत्तर से मिलान करके, या वेबसाइट की अंतिम स्थिति की जाँच करके — इसलिए मूल्यांकन मशीन करती है, इंसान नहीं।
- यह क्यों मायने रखता है
- यह दिखाता है कि क्या LLM एजेंट सचमुच असली वेबसाइटों को शुरू से अंत तक चला सकते हैं — यह एकल-चरण या कृत्रिम web कार्यों से कहीं कठिन और व्यावहारिक परीक्षा है — जिससे यह एजेंटिक web ऑटोमेशन का एक अहम मापदंड बन जाता है।
हल किया गया उदाहरण
कार्य
आप WebArena के सेल्फ-होस्टेड GitLab परिवेश में एक स्वायत्त वेब एजेंट हैं: आप पेज की accessibility tree देखते हैं और हर चरण में WebArena के ऐक्शन-स्पेस से एक क्रिया देते हैं (जैसे
click [id], type [id] [text] [enter], goto [url], stop [answer])। लक्ष्य: a11yproject/a11yproject.com रिपॉज़िटरी में Bug: login button unresponsive शीर्षक वाला एक नया issue बनाएँ और उसे स्वयं को असाइन करें।समाधान
goto [http://gitlab.webarena/a11yproject/a11yproject.com/-/issues/new]
type [1023] [Bug: login button unresponsive] [0]
click [1187] # open the Assignee dropdown
click [1203] # choose "Assign to me"
click [1250] # click the "Create issue" button
stop [N/A]
व्याख्या
यह ट्रैजेक्टरी नया issue फ़ॉर्म खोलती है, सटीक शीर्षक टाइप करती है, असाइनी मेनू से इसे स्वयं को असाइन करती है और सबमिट करती है; चूँकि कार्य कोई मान लौटाने के बजाय स्थिति (state) बदलता है, इसलिए
stop [N/A] एपिसोड समाप्त करता है। WebArena का program_html मूल्यांकनकर्ता बनाए गए issue को फिर से लोड करके DOM की कार्यात्मक जाँच करता है — शीर्षक दी गई स्ट्रिंग के बराबर और असाइनी लॉग-इन उपयोगकर्ता के बराबर — इसलिए लगभग-सही परिणाम को 0 अंक मिलते हैं।| तारीख़ | मॉडल | स्कोर | स्रोत |
|---|---|---|---|
| 2026-07-31 | Qwen-UI-Agent | 73.6% | Qwen-UI-Agent मोबाइल-यूज़ बेंचमार्क्स पर स्टेट ऑफ़ द आर्ट स्थापित करता है |
| 2026-02-24 | GUI-Owl-1.5 | 48.4% | GUI-Owl-1.5 बहु-प्लेटफ़ॉर्म मौलिक GUI एजेंट्स को पेश करता है |
| 2026-01-12 | ColorBrowserAgent | 71.2% | ColorBrowserAgent मजबूत दीर्घकालिक वेब स्वचालन के लिए अनुकूलित ज्ञान विकास पेश करता है |
| 2025-10-22 | Surfer 2 | 69.6% | Surfer 2 दृश्य अवलोकन के माध्यम से क्रॉस-प्लेटफ़ॉर्म कंप्यूटर उपयोग में राज्य-कला प्राप्त करता है |
| 2025-01-23 | CUA | 58.1% | OpenAI ने कंप्यूटर-यूजिंग एजेंट (CUA) द्वारा संचालित ऑपरेटर शोध पूर्वावलोकन का परिचय दिया |
| 2024-10-17 | AgentOccam | 9.8% | AgentOccam अवलोकन और क्रिया स्थानों को संरेखित करके LLM वेब एजेंट के प्रदर्शन को बढ़ाता है |
| 2024-08-08 | AWA 1.5 | 57.14% | WebArena बेंचमार्क पर AWA 1.5 ने 57.14% हासिल किया |
| 2023-10-05 | SteP | 33.5% | SteP वेब कार्य प्रदर्शन में सुधार के लिए स्टैक्ड LLM नीतियों का उपयोग करता है |
| 2023-07-25 | GPT-4-based agent | 14.41% | WebArena: स्वतंत्र एजेंट्स के लिए यथार्थवादी वेब वातावरण |