Benchmark · agentic

OSWorld

28 条结果 22 个模型

OSWorld 是一个基准测试,用于在真实桌面操作系统的任务上评估计算机使用智能体,这些任务涵盖日常应用(文件管理器、网页浏览器、办公套件)。它报告智能体成功完成任务的百分比。

了解更多
示例
一个任务可能要求智能体打开电子表格、修改某个数值或重新格式化数据并保存文件,或者在文件管理器中找到某个文件并更改系统设置——像人一样操作真实的图形界面(GUI)。
评分方式
指标是任务成功率(task success rate),以百分比表示。每个任务要么通过要么失败,最终得分是整个任务集中通过任务所占的比例。
验证方式
结果由基于执行的脚本自动检查,这些脚本检查机器的最终状态(例如,正确的文件、数值或设置现在是否存在),而不是比对文本或人工投票。
为何重要
它衡量 AI 智能体能否真正跨多个应用操作一台真实的计算机——这比回答问题或单一应用的任务是一项更难、更贴近现实的自主性测试。
示例解析
任务
Ubuntu 桌面上打开着一个 GNOME Terminal。在文件夹 ~/project 中,递归查找所有大于 10 MB 的 .log 文件并将其删除,其他文件保持不变。
解答
find ~/project -type f -name '*.log' -size +10M -delete
解析
find 递归遍历 ~/project,匹配名为 *.log 且大于 10 MB 的普通文件,-delete 只删除这些文件而不影响其余文件。OSWorld 通过每个任务专属的检查脚本检查虚拟机(VM)最终的文件系统状态,仅当目标 logs 被删除且其他文件仍在时才给予 reward 1。
0 24 48 72 96 2024-04-11 2025-06-11 2026-08-11 best model · 12.2 · 2024-04-11 Claude 3.5 Sonnet (New) · 14.9 · 2024-10-22 Claude 3.5 Sonnet · 14.9 · 2024-10-22 UI-TARS · 24.6 · 2025-01-21 CUA · 38.1 · 2025-01-23 GUI-Owl-7B · 29.4 · 2025-08-21 Mobile-Agent-v3 · 37.7 · 2025-08-21 GUI-Owl (with TRPO) · 34.9 · 2025-08-21 UI-TARS-2 · 47.5 · 2025-09-02 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-30 Surfer 2 · 60.1 · 2025-10-22 Claude Opus 4.6 · 72.7 · 2026-02-05 Claude Sonnet 4.6 · 72.5 · 2026-02-17 GUI-Owl-1.5 · 56.5 · 2026-02-24 GPT-5.5 · 78.7 · 2026-04-25 OpenCUA-72B · 48.9 · 2026-07-06 GPT-5.6 Sol · 62.6 · 2026-07-09 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-27 Muse Glimmer · 65.9 · 2026-08-10 Opus 5 · 90.7 · 2026-08-11
best model Claude 3.5 Sonnet (New) Claude 3.5 Sonnet UI-TARS CUA GUI-Owl-7B Mobile-Agent-v3 GUI-Owl (with TRPO) UI-TARS-2 Claude Sonnet 4.5 Surfer 2 Claude Opus 4.6 Claude Sonnet 4.6 GUI-Owl-1.5 GPT-5.5 OpenCUA-72B GPT-5.6 Sol Gemini 3.6 Flash Gemini 3.5 Flash-Lite OpenForgeGUI Muse Glimmer Opus 5
时间线
日期 模型 得分 来源
2026-08-11 Opus 5 90.69% Ouroboros 自开发智能体使用 Opus 5 创下新基准记录
2026-08-10 Muse Glimmer 65.9% Meta发布Muse Glimmer:一款在单张消费级GPU上运行的30B开源权重智能体模型
2026-07-27 OpenForgeGUI 37.7% OpenForgeRL 支持在任何环境中对基于工具链的智能体进行端到端训练
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL 支持在任何环境中对基于工具链的代理进行端到端训练
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL 支持在任何环境中对基于工具链的智能体进行端到端训练
2026-07-21 Gemini 3.5 Flash-Lite 74.0% Google发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber,面向智能体工作负载
2026-07-21 Gemini 3.6 Flash 83.0% Google发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber,面向智能体工作负载
2026-07-21 Gemini 3.6 Flash 83.0% Google发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber
2026-07-21 Gemini 3.5 Flash-Lite 74.0% Google发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber
2026-07-09 GPT-5.6 Sol 62.6% OpenAI 发布 GPT-5.6 系列,包含 Sol、Terra 和 Luna 模型
2026-07-06 OpenCUA-72B 48.9% 从失败中学习:计算机使用代理的推理时自我改进
2026-04-25 GPT-5.5 78.7% OpenAI发布GPT-5.5,一款从头重新训练、原生支持全模态处理的模型
2026-02-24 GUI-Owl-1.5 56.5% GUI-Owl-1.5 引入多平台基础 GUI 智能体
2026-02-17 Claude Sonnet 4.6 72.5% Anthropic发布Claude Sonnet 4.6,提升编码、计算机使用能力及100万token上下文
2026-02-05 Claude Opus 4.6 72.7% Anthropic 发布 Claude Opus 4.6,具备 1M 上下文窗口和智能体改进
2025-10-22 Surfer 2 60.1% Surfer 2 通过视觉观测实现跨平台计算机使用的最先进水平
2025-09-30 Claude Sonnet 4.5 61.4% Anthropic 发布 Claude Sonnet 4.5,增强编码与智能体能力
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic 发布 Claude Sonnet 4.5,增强编码、计算机使用和安全性对齐
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic
2025-09-02 UI-TARS-2 47.5% UI-TARS-2 通过多轮强化学习推进 GUI 代理
2025-08-21 GUI-Owl-7B 29.4% Mobile-Agent-v3 推出 GUI-Owl,在 AndroidWorld 和 OSWorld 上创下新的开源 SOTA
2025-08-21 Mobile-Agent-v3 37.7% Mobile-Agent-v3 推出 GUI-Owl,在 AndroidWorld 和 OSWorld 上创下新的开源 SOTA
2025-08-21 GUI-Owl (with TRPO) 34.9% Mobile-Agent-v3 推出 GUI-Owl,在 AndroidWorld 和 OSWorld 上创下新的开源 SOTA
2025-01-23 CUA 38.1% OpenAI 推出由 Computer-Using Agent (CUA) 驱动的 Operator 研究预览版
2025-01-21 UI-TARS 24.6% UI-TARS 推出原生 GUI 智能体模型,性能超越商业框架
2024-10-22 Claude 3.5 Sonnet (New) 14.9% Anthropic发布Claude 3.5 Haiku及具备计算机使用能力的升级版Claude 3.5 Sonnet
2024-10-22 Claude 3.5 Sonnet 14.9% Anthropic升级Claude 3.5 Sonnet,发布Claude 3.5 Haiku及计算机使用功能公测版
2024-04-11 best model 12.24% OSWorld 推出针对真实计算机环境中多模态智能体的基准测试