Les chercheurs présentent OSWorld, le premier environnement informatique réel et évolutif conçu pour évaluer des agents multimodaux sur des tâches ouvertes sous Ubuntu, Windows et macOS.

  • Le benchmark comprend 369 tâches informatiques dérivées de cas d'utilisation du monde réel impliquant des applications web et de bureau, des E/S de fichiers et des flux de travail multi-applications.
  • Chaque tâche dispose d'une configuration détaillée de l'état initial et de scripts d'évaluation basés sur l'exécution pour une évaluation fiable.
  • Les évaluations des agents LLM/VLM de pointe montrent des déficiences significatives, le meilleur modèle atteignant seulement 12,24 % de succès par rapport aux performances humaines supérieures à 72,36 %.
  • Les difficultés principales identifiées sont l'ancrage GUI et les connaissances opérationnelles.

Ce benchmark fournit un environnement unifié pour évaluer la scalabilité des agents et offre des perspectives pour développer des agents généralistes multimodaux que les benchmarks précédents ne pouvaient pas supporter.