Benchmark · agentic
WebArena
WebArena 测试自主 web 智能体能否在一组真实的自托管网站上完成真实的多步骤任务,包括在线购物、论坛和内容管理系统(CMS)。其指标是 task success rate(任务成功率):智能体正确完成任务的百分比。
了解更多
- 示例
- 一个典型任务:「找到某一类别中最便宜的商品并把两件加入购物车」,智能体必须在真实站点上通过浏览、点击和输入来达成目标。
- 评分方式
- 指标是任务成功率:完成的任务数除以任务总数,以百分比表示。
- 验证方式
- 每个任务都自带一个程序化校验器,自动验证结果——要么比对预期答案,要么检查网站最终状态——因此评分由机器完成,而非人工判定。
- 为何重要
- 它衡量 LLM 智能体能否端到端地真正操作真实网站,比单步或合成的 web 任务更难、更贴近实际,因而是智能体式 web 自动化的重要标尺。
示例解析
任务
你是 WebArena 自托管 GitLab 环境中的自主网页代理:你观察页面的可访问性树(accessibility tree),每一步从 WebArena 动作空间中输出一个动作(例如
click [id]、type [id] [text] [enter]、goto [url]、stop [answer])。目标:在 a11yproject/a11yproject.com 仓库中创建一个标题为 Bug: login button unresponsive 的新议题(issue),并将其指派给你自己。解答
goto [http://gitlab.webarena/a11yproject/a11yproject.com/-/issues/new]
type [1023] [Bug: login button unresponsive] [0]
click [1187] # open the Assignee dropdown
click [1203] # choose "Assign to me"
click [1250] # click the "Create issue" button
stop [N/A]
解析
该轨迹打开新建 issue 表单,输入准确的标题,通过指派人菜单将其指派给自己,然后提交;由于任务是改变状态而非返回某个值,
stop [N/A] 结束该回合。WebArena 的 program_html 评测器会重新加载所创建的 issue 并按功能检查 DOM——标题等于给定字符串、指派人等于当前登录用户——因此接近但不完全正确的结果得 0 分。| 日期 | 模型 | 得分 | 来源 |
|---|---|---|---|
| 2026-07-31 | Qwen-UI-Agent | 73.6% | Qwen-UI-Agent在移动使用基准测试中创下新纪录 |
| 2026-02-24 | GUI-Owl-1.5 | 48.4% | GUI-Owl-1.5 引入多平台基础 GUI 智能体 |
| 2026-01-12 | ColorBrowserAgent | 71.2% | ColorBrowserAgent引入自适应知识演化以实现稳健的长周期网页自动化 |
| 2025-10-22 | Surfer 2 | 69.6% | Surfer 2 通过视觉观测实现跨平台计算机使用的最先进水平 |
| 2025-01-23 | CUA | 58.1% | OpenAI 推出由 Computer-Using Agent (CUA) 驱动的 Operator 研究预览版 |
| 2024-10-17 | AgentOccam | 9.8% | AgentOccam 对齐观测与动作空间以提升 LLM Web 智能体性能 |
| 2024-08-08 | AWA 1.5 | 57.14% | AWA 1.5 在 WebArena 基准测试中达到 57.14% |
| 2023-10-05 | SteP | 33.5% | SteP 使用堆叠的 LLM 策略来提升网页任务性能 |
| 2023-07-25 | GPT-4-based agent | 14.41% | WebArena:用于自主代理的真实网络环境 |