本文介绍了 UI-TARS,这是一种端到端原生 GUI 智能体模型,它将截图作为输入,并执行类似人类的键盘和鼠标交互,无需依赖封装的商业模型。
- 在评估感知、定位和任务执行的 10 多个 GUI 智能体基准测试中取得了最先进的性能。
- 在 OSWorld 基准测试中,50 步得分 24.6,15 步得分 22.7,优于 Claude(分别为 22.0 和 14.9)。
- 在 AndroidWorld 中达到 46.6 分,超越了 GPT-4o 的 34.5 分。
- 通过大规模 GUI 截图数据集增强感知能力,以实现精确的图像描述。
- 利用统一的动作建模标准化跨平台动作,实现精确定位。
- 实施 System-2 推理以进行多步决策,包括任务分解和反思。
- 使用从数百台虚拟机收集的带有反思的在线轨迹进行迭代训练,以解决数据瓶颈问题。
作者分析了 GUI 智能体的演进路径,以指导该领域的进一步发展,证明原生模型可以超越依赖专家精心设计的提示的复杂框架。