Benchmark · agentic

WebArena

9 条结果 9 个模型

WebArena 测试自主 web 智能体能否在一组真实的自托管网站上完成真实的多步骤任务,包括在线购物、论坛和内容管理系统(CMS)。其指标是 task success rate(任务成功率):智能体正确完成任务的百分比。

了解更多
示例
一个典型任务:「找到某一类别中最便宜的商品并把两件加入购物车」,智能体必须在真实站点上通过浏览、点击和输入来达成目标。
评分方式
指标是任务成功率:完成的任务数除以任务总数,以百分比表示。
验证方式
每个任务都自带一个程序化校验器,自动验证结果——要么比对预期答案,要么检查网站最终状态——因此评分由机器完成,而非人工判定。
为何重要
它衡量 LLM 智能体能否端到端地真正操作真实网站,比单步或合成的 web 任务更难、更贴近实际,因而是智能体式 web 自动化的重要标尺。
示例解析
任务
你是 WebArena 自托管 GitLab 环境中的自主网页代理:你观察页面的可访问性树(accessibility tree),每一步从 WebArena 动作空间中输出一个动作(例如 click [id]type [id] [text] [enter]goto [url]stop [answer])。目标:在 a11yproject/a11yproject.com 仓库中创建一个标题为 Bug: login button unresponsive 的新议题(issue),并将其指派给你自己。
解答
goto [http://gitlab.webarena/a11yproject/a11yproject.com/-/issues/new]
type [1023] [Bug: login button unresponsive] [0]
click [1187]        # open the Assignee dropdown
click [1203]        # choose "Assign to me"
click [1250]        # click the "Create issue" button
stop [N/A]
解析
该轨迹打开新建 issue 表单,输入准确的标题,通过指派人菜单将其指派给自己,然后提交;由于任务是改变状态而非返回某个值,stop [N/A] 结束该回合。WebArena 的 program_html 评测器会重新加载所创建的 issue 并按功能检查 DOM——标题等于给定字符串、指派人等于当前登录用户——因此接近但不完全正确的结果得 0 分。
0 19.5 39 58.5 78 2023-07-25 2025-01-26 2026-07-31 GPT-4-based agent · 14.4 · 2023-07-25 SteP · 33.5 · 2023-10-05 AWA 1.5 · 57.1 · 2024-08-08 AgentOccam · 9.8 · 2024-10-17 CUA · 58.1 · 2025-01-23 Surfer 2 · 69.6 · 2025-10-22 ColorBrowserAgent · 71.2 · 2026-01-12 GUI-Owl-1.5 · 48.4 · 2026-02-24 Qwen-UI-Agent · 73.6 · 2026-07-31
GPT-4-based agent SteP AWA 1.5 AgentOccam CUA Surfer 2 ColorBrowserAgent GUI-Owl-1.5 Qwen-UI-Agent
时间线
日期 模型 得分 来源
2026-07-31 Qwen-UI-Agent 73.6% Qwen-UI-Agent在移动使用基准测试中创下新纪录
2026-02-24 GUI-Owl-1.5 48.4% GUI-Owl-1.5 引入多平台基础 GUI 智能体
2026-01-12 ColorBrowserAgent 71.2% ColorBrowserAgent引入自适应知识演化以实现稳健的长周期网页自动化
2025-10-22 Surfer 2 69.6% Surfer 2 通过视觉观测实现跨平台计算机使用的最先进水平
2025-01-23 CUA 58.1% OpenAI 推出由 Computer-Using Agent (CUA) 驱动的 Operator 研究预览版
2024-10-17 AgentOccam 9.8% AgentOccam 对齐观测与动作空间以提升 LLM Web 智能体性能
2024-08-08 AWA 1.5 57.14% AWA 1.5 在 WebArena 基准测试中达到 57.14%
2023-10-05 SteP 33.5% SteP 使用堆叠的 LLM 策略来提升网页任务性能
2023-07-25 GPT-4-based agent 14.41% WebArena:用于自主代理的真实网络环境