Pesquisadores apresentam o OSWorld, o primeiro ambiente de computador real e escalável projetado para avaliar agentes multimodais em tarefas abertas no Ubuntu, Windows e macOS.
- O benchmark inclui 369 tarefas de computador derivadas de casos de uso do mundo real envolvendo aplicativos web e desktop, E/S de arquivos e fluxos de trabalho multiaplicativos.
- Cada tarefa possui uma configuração detalhada do estado inicial e scripts de avaliação baseados em execução para uma avaliação confiável.
- As avaliações de agentes LLM/VLM de última geração mostram deficiências significativas, com o melhor modelo alcançando apenas 12,24% de sucesso em comparação com o desempenho humano superior a 72,36%.
- As principais dificuldades identificadas são fundamentação da GUI e conhecimento operacional.
Este benchmark fornece um ambiente unificado para avaliar a escalabilidade de agentes e oferece insights para desenvolver agentes generalistas multimodais que os benchmarks anteriores não podiam suportar.