Benchmark · agentic
OSWorld
OSWorld é um benchmark que testa agentes de uso de computador em tarefas reais de um sistema operacional de desktop, abrangendo aplicativos do dia a dia (gerenciadores de arquivos, navegadores web, suítes de escritório). Ele relata a porcentagem de tarefas que o agente conclui com sucesso.
Saiba mais
- Exemplo
- Uma tarefa pode pedir que o agente abra uma planilha, edite um valor ou reformate dados e salve o arquivo, ou que encontre um arquivo no gerenciador de arquivos e altere uma configuração do sistema, operando a interface gráfica (GUI) real assim como uma pessoa faria.
- Pontuação
- A métrica é a taxa de sucesso das tarefas (task success rate), expressa em porcentagem. Cada tarefa é aprovada ou reprovada, e a pontuação é a fração de tarefas aprovadas em todo o conjunto.
- Verificação
- Os resultados são verificados automaticamente por scripts baseados em execução que inspecionam o estado final da máquina (por exemplo, se o arquivo, valor ou configuração corretos agora existem), em vez de comparar texto ou votos humanos.
- Por que importa
- Ele mede se os agentes de IA conseguem realmente operar um computador real em vários aplicativos — um teste de autonomia muito mais difícil e realista do que responder perguntas ou tarefas de um único aplicativo.
Exemplo resolvido
Tarefa
Há um GNOME Terminal aberto na área de trabalho do Ubuntu. Na pasta ~/project, encontre recursivamente todos os arquivos .log maiores que 10 MB e apague-os, mantendo os demais arquivos intactos.
Solução
find ~/project -type f -name '*.log' -size +10M -delete
Explicação
find percorre ~/project recursivamente, seleciona arquivos comuns chamados *.log com mais de 10 MB e -delete remove exatamente esses, poupando o restante. O OSWorld avalia com um verificador próprio de cada tarefa sobre o estado final do sistema de arquivos da máquina virtual (VM), concedendo reward 1 apenas se os logs alvo sumiram e os outros arquivos permaneceram.