Benchmark · agentic

WebArena

9 hasil 9 model

WebArena menguji apakah agen web otonom dapat menyelesaikan tugas nyata yang berlangkah banyak pada sekumpulan situs web realistis yang di-host sendiri — toko online, sebuah forum, dan sistem manajemen konten (CMS). Metriknya adalah task success rate (tingkat keberhasilan tugas): persentase tugas yang diselesaikan agen dengan benar.

Selengkapnya
Contoh
Contoh tugas yang khas: «temukan produk termurah dalam sebuah kategori dan tambahkan dua unit ke keranjang», yang harus dicapai agen dengan menjelajah, mengeklik, dan mengetik di situs sungguhan.
Penilaian
Metriknya adalah tingkat keberhasilan tugas: jumlah tugas yang selesai dibagi total tugas, dinyatakan dalam persentase.
Verifikasi
Setiap tugas disertai pemeriksa programatis yang memverifikasi hasil secara otomatis — dengan mencocokkan jawaban yang diharapkan atau memeriksa keadaan akhir situs — sehingga penilaian dilakukan mesin, bukan manusia.
Mengapa penting
Ia menunjukkan apakah agen LLM benar-benar bisa mengoperasikan situs web nyata dari ujung ke ujung — pengujian yang lebih sulit dan praktis daripada tugas web satu langkah atau sintetis — sehingga menjadi tolok ukur penting bagi otomasi web berbasis agen.
Contoh penyelesaian
Tugas
Anda adalah agen web otonom di lingkungan GitLab swakelola milik WebArena: Anda mengamati accessibility tree halaman dan pada setiap langkah mengeluarkan satu aksi dari ruang aksi WebArena (misalnya click [id], type [id] [text] [enter], goto [url], stop [answer]). Tujuan: buat issue baru berjudul Bug: login button unresponsive di repositori a11yproject/a11yproject.com dan tetapkan ke diri Anda sendiri.
Solusi
goto [http://gitlab.webarena/a11yproject/a11yproject.com/-/issues/new]
type [1023] [Bug: login button unresponsive] [0]
click [1187]        # open the Assignee dropdown
click [1203]        # choose "Assign to me"
click [1250]        # click the "Create issue" button
stop [N/A]
Penjelasan
Trajektori membuka formulir issue baru, mengetik judul yang tepat, menetapkannya ke diri sendiri lewat menu assignee, lalu mengirimkannya; stop [N/A] mengakhiri episode karena tugas mengubah state alih-alih mengembalikan sebuah nilai. Evaluator program_html WebArena memuat ulang issue yang dibuat dan memeriksa DOM secara fungsional — judul sama dengan string dan assignee sama dengan pengguna yang login — sehingga hasil yang nyaris benar mendapat nilai 0.
0 19.5 39 58.5 78 2023-07-25 2025-01-26 2026-07-31 GPT-4-based agent · 14.4 · 2023-07-25 SteP · 33.5 · 2023-10-05 AWA 1.5 · 57.1 · 2024-08-08 AgentOccam · 9.8 · 2024-10-17 CUA · 58.1 · 2025-01-23 Surfer 2 · 69.6 · 2025-10-22 ColorBrowserAgent · 71.2 · 2026-01-12 GUI-Owl-1.5 · 48.4 · 2026-02-24 Qwen-UI-Agent · 73.6 · 2026-07-31
GPT-4-based agent SteP AWA 1.5 AgentOccam CUA Surfer 2 ColorBrowserAgent GUI-Owl-1.5 Qwen-UI-Agent
Linimasa
Tanggal Model Skor Sumber
2026-07-31 Qwen-UI-Agent 73.6% Qwen-UI-Agent menetapkan standar terbaru pada benchmark penggunaan seluler
2026-02-24 GUI-Owl-1.5 48.4% GUI-Owl-1.5 memperkenalkan agen GUI fundamental multi-platform
2026-01-12 ColorBrowserAgent 71.2% ColorBrowserAgent memperkenalkan evolusi pengetahuan adaptif untuk otomatisasi web jangka panjang yang kuat
2025-10-22 Surfer 2 69.6% Surfer 2 mencapai penggunaan komputer lintas platform terbaik melalui pengamatan visual
2025-01-23 CUA 58.1% OpenAI memperkenalkan Agen Pengguna Komputer (CUA) yang mendukung pratinjau riset Operator
2024-10-17 AgentOccam 9.8% AgentOccam menyelaraskan ruang observasi dan aksi untuk meningkatkan kinerja agen web berbasis LLM
2024-08-08 AWA 1.5 57.14% AWA 1.5 mencapai 57,14% pada benchmark WebArena
2023-10-05 SteP 33.5% SteP menggunakan kebijakan LLM bertumpuk untuk meningkatkan kinerja tugas web
2023-07-25 GPT-4-based agent 14.41% WebArena: lingkungan web realistis untuk agen otonom