Benchmark · agentic

Android World

6 条结果 6 个模型

AndroidWorld 是一个面向自主智能体的基准与实时模拟器环境(Google,2024),智能体在真实的 Android 设备上操作;它包含跨 20 个真实应用手工构建的 116 个任务,指标为任务成功率(success rate)。

了解更多
示例
智能体获得一个自然语言目标,必须操作真实应用来完成它——例如,在日历应用中,通过点击、输入和滚动实时界面,创建一个带有指定标题、日期和时间的事件。
评分方式
每个任务给出二元奖励:若最终设备状态满足该任务的成功条件则为 1,否则为 0。分数即成功率,也就是已解决任务所占的比例,在整个任务集上取平均(任务以随机值参数化,因此每次运行都会有所不同)。
验证方式
成功与否通过在运行后以程序方式检查设备上的系统/应用状态来判定(例如查询某应用的数据库、文件或设置),而不是比对动作轨迹或使用 LLM 评审,从而使奖励持久且可复现。
为何重要
它在真实、开放式的移动设备操控上评估智能体,并给出可验证的奖励;随机参数可防止死记硬背,真实应用加上基于状态的评分使其成为面向多模态计算机操作智能体的持久、可复现测试平台。
示例解析
任务
任务(ContactsAddContact 系列):「为 Grace Taylor 创建一个新联系人。其电话号码为 555-123-4567。」智能体通过无障碍树和屏幕截图操作实时的“通讯录”应用。
解答
打开“通讯录”应用 → 点击“添加联系人” → 输入姓名 Grace Taylor → 输入号码 555-123-4567 → 点击“保存”。最终状态:设备的联系人存储中现在有一个名为 Grace Taylor、号码为 555-123-4567 的联系人。
解析
之所以正确,是因为该任务的成功校验器查询设备上的联系人,并确认存在一个姓名和号码与目标完全一致的联系人;评分是对状态的二元检查(奖励 1/0),与智能体如何到达该状态无关。
0 23 46 69 92 2025-01-21 2025-08-08 2026-02-24 UI-TARS · 46.6 · 2025-01-21 GUI-Owl-7B · 66.4 · 2025-08-21 Mobile-Agent-v3 · 73.3 · 2025-08-21 UI-TARS-2 · 73.3 · 2025-09-02 Surfer 2 · 87.1 · 2025-10-22 GUI-Owl-1.5 · 71.6 · 2026-02-24
UI-TARS GUI-Owl-7B Mobile-Agent-v3 UI-TARS-2 Surfer 2 GUI-Owl-1.5
时间线
日期 模型 得分 来源
2026-02-24 GUI-Owl-1.5 71.6% GUI-Owl-1.5 引入多平台基础 GUI 智能体
2025-10-22 Surfer 2 87.1% Surfer 2 通过视觉观测实现跨平台计算机使用的最先进水平
2025-09-02 UI-TARS-2 73.3% UI-TARS-2 通过多轮强化学习推进 GUI 代理
2025-08-21 GUI-Owl-7B 66.4% Mobile-Agent-v3 推出 GUI-Owl,在 AndroidWorld 和 OSWorld 上创下新的开源 SOTA
2025-08-21 Mobile-Agent-v3 73.3% Mobile-Agent-v3 推出 GUI-Owl,在 AndroidWorld 和 OSWorld 上创下新的开源 SOTA
2025-01-21 UI-TARS 46.6% UI-TARS 推出原生 GUI 智能体模型,性能超越商业框架