Benchmark · agentic

OSWorld

28 resultados 22 modelos

OSWorld é um benchmark que testa agentes de uso de computador em tarefas reais de um sistema operacional de desktop, abrangendo aplicativos do dia a dia (gerenciadores de arquivos, navegadores web, suítes de escritório). Ele relata a porcentagem de tarefas que o agente conclui com sucesso.

Saiba mais
Exemplo
Uma tarefa pode pedir que o agente abra uma planilha, edite um valor ou reformate dados e salve o arquivo, ou que encontre um arquivo no gerenciador de arquivos e altere uma configuração do sistema, operando a interface gráfica (GUI) real assim como uma pessoa faria.
Pontuação
A métrica é a taxa de sucesso das tarefas (task success rate), expressa em porcentagem. Cada tarefa é aprovada ou reprovada, e a pontuação é a fração de tarefas aprovadas em todo o conjunto.
Verificação
Os resultados são verificados automaticamente por scripts baseados em execução que inspecionam o estado final da máquina (por exemplo, se o arquivo, valor ou configuração corretos agora existem), em vez de comparar texto ou votos humanos.
Por que importa
Ele mede se os agentes de IA conseguem realmente operar um computador real em vários aplicativos — um teste de autonomia muito mais difícil e realista do que responder perguntas ou tarefas de um único aplicativo.
Exemplo resolvido
Tarefa
Há um GNOME Terminal aberto na área de trabalho do Ubuntu. Na pasta ~/project, encontre recursivamente todos os arquivos .log maiores que 10 MB e apague-os, mantendo os demais arquivos intactos.
Solução
find ~/project -type f -name '*.log' -size +10M -delete
Explicação
find percorre ~/project recursivamente, seleciona arquivos comuns chamados *.log com mais de 10 MB e -delete remove exatamente esses, poupando o restante. O OSWorld avalia com um verificador próprio de cada tarefa sobre o estado final do sistema de arquivos da máquina virtual (VM), concedendo reward 1 apenas se os logs alvo sumiram e os outros arquivos permaneceram.
0 24 48 72 96 2024-04-11 2025-06-11 2026-08-11 best model · 12.2 · 2024-04-11 Claude 3.5 Sonnet (New) · 14.9 · 2024-10-22 Claude 3.5 Sonnet · 14.9 · 2024-10-22 UI-TARS · 24.6 · 2025-01-21 CUA · 38.1 · 2025-01-23 GUI-Owl-7B · 29.4 · 2025-08-21 Mobile-Agent-v3 · 37.7 · 2025-08-21 GUI-Owl (with TRPO) · 34.9 · 2025-08-21 UI-TARS-2 · 47.5 · 2025-09-02 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-30 Surfer 2 · 60.1 · 2025-10-22 Claude Opus 4.6 · 72.7 · 2026-02-05 Claude Sonnet 4.6 · 72.5 · 2026-02-17 GUI-Owl-1.5 · 56.5 · 2026-02-24 GPT-5.5 · 78.7 · 2026-04-25 OpenCUA-72B · 48.9 · 2026-07-06 GPT-5.6 Sol · 62.6 · 2026-07-09 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-27 Muse Glimmer · 65.9 · 2026-08-10 Opus 5 · 90.7 · 2026-08-11
best model Claude 3.5 Sonnet (New) Claude 3.5 Sonnet UI-TARS CUA GUI-Owl-7B Mobile-Agent-v3 GUI-Owl (with TRPO) UI-TARS-2 Claude Sonnet 4.5 Surfer 2 Claude Opus 4.6 Claude Sonnet 4.6 GUI-Owl-1.5 GPT-5.5 OpenCUA-72B GPT-5.6 Sol Gemini 3.6 Flash Gemini 3.5 Flash-Lite OpenForgeGUI Muse Glimmer Opus 5
Linha do tempo
Data Modelo Pontuação Fonte
2026-08-11 Opus 5 90.69% Agente auto-desenvolvedor Ouroboros estabelece novos recordes com Opus 5
2026-08-10 Muse Glimmer 65.9% Meta lança Muse Glimmer, um modelo agêntico de pesos abertos com 30B que roda em uma GPU de consumo
2026-07-27 OpenForgeGUI 37.7% OpenForgeRL permite o treinamento de ponta a ponta de agentes baseados em harness em qualquer ambiente
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL permite treinamento de ponta a ponta de agentes baseados em harness em qualquer ambiente
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL permite o treinamento de ponta a ponta de agentes baseados em harness em qualquer ambiente
2026-07-21 Gemini 3.5 Flash-Lite 74.0% Google lança Gemini 3.6 Flash, 3.5 Flash-Lite e 3.5 Flash Cyber para cargas de trabalho agênticas
2026-07-21 Gemini 3.6 Flash 83.0% Google lança Gemini 3.6 Flash, 3.5 Flash-Lite e 3.5 Flash Cyber para cargas de trabalho agênticas
2026-07-21 Gemini 3.6 Flash 83.0% Google lança Gemini 3.6 Flash, 3.5 Flash-Lite e 3.5 Flash Cyber
2026-07-21 Gemini 3.5 Flash-Lite 74.0% Google lança Gemini 3.6 Flash, 3.5 Flash-Lite e 3.5 Flash Cyber
2026-07-09 GPT-5.6 Sol 62.6% OpenAI lança a família GPT-5.6 com modelos Sol, Terra e Luna
2026-07-06 OpenCUA-72B 48.9% Aprendendo com o fracasso: autoaperfeiçoamento em tempo de inferência para agentes de uso computacional
2026-04-25 GPT-5.5 78.7% OpenAI lança GPT-5.5, um modelo retreinado do zero com processamento omnimodal nativo
2026-02-24 GUI-Owl-1.5 56.5% GUI-Owl-1.5 introduz agentes fundamentais de GUI multiplataforma
2026-02-17 Claude Sonnet 4.6 72.5% Anthropic lança Claude Sonnet 4.6 com melhorias em codificação, uso de computador e contexto de 1M de tokens
2026-02-05 Claude Opus 4.6 72.7% Anthropic lança Claude Opus 4.6 com janela de contexto de 1M e melhorias agênticas
2025-10-22 Surfer 2 60.1% Surfer 2 atinge o estado da arte no uso de computadores multiplataforma por observação visual
2025-09-30 Claude Sonnet 4.5 61.4% Anthropic lança Claude Sonnet 4.5 com capacidades aprimoradas de codificação e agentes
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic lança Claude Sonnet 4.5 com melhorias em codificação, uso do computador e alinhamento
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic
2025-09-02 UI-TARS-2 47.5% UI-TARS-2 avança agente de GUI com aprendizado por reforço multironda
2025-08-21 GUI-Owl-7B 29.4% Mobile-Agent-v3 apresenta o GUI-Owl, estabelecendo novo SOTA open-source no AndroidWorld e OSWorld
2025-08-21 Mobile-Agent-v3 37.7% Mobile-Agent-v3 apresenta o GUI-Owl, estabelecendo novo SOTA open-source no AndroidWorld e OSWorld
2025-08-21 GUI-Owl (with TRPO) 34.9% Mobile-Agent-v3 apresenta o GUI-Owl, estabelecendo novo SOTA open-source no AndroidWorld e OSWorld
2025-01-23 CUA 38.1% OpenAI apresenta Agente de Uso do Computador (CUA) que impulsiona a prévia de pesquisa do Operator
2025-01-21 UI-TARS 24.6% UI-TARS apresenta modelo nativo de agente de GUI que supera frameworks comerciais
2024-10-22 Claude 3.5 Sonnet (New) 14.9% Anthropic lança Claude 3.5 Haiku e versão aprimorada do Claude 3.5 Sonnet com uso de computador
2024-10-22 Claude 3.5 Sonnet 14.9% Anthropic atualiza Claude 3.5 Sonnet, lança Claude 3.5 Haiku e versão beta de uso do computador
2024-04-11 best model 12.24% OSWorld apresenta benchmark para agentes multimodais em ambientes de computador reais