研究人员推出了 OSWorld,这是首个可扩展的真实计算机环境,旨在评估在 Ubuntu、Windows 和 macOS 上处理开放式任务的多模态智能体。

  • 该基准测试包含 369 个源自现实世界用例的计算机任务,涉及 Web 和桌面应用、文件 I/O 以及多应用工作流。
  • 每个任务都包含详细的初始状态设置和基于执行的自定义评估脚本,以确保可靠的评估。
  • 对最先进的基于 LLM/VLM 的智能体进行评估显示存在显著缺陷,最佳模型的成功率仅为 12.24%,而人类表现超过 72.36%。
  • 确定的主要困难是 GUI 定位和操作知识。

该基准测试提供了一个统一的环境来评估智能体的可扩展性,并为开发多模态通用智能体提供了见解,这是以前的基准测试无法支持的。