Los investigadores presentan OSWorld, el primer entorno informático real y escalable diseñado para evaluar agentes multimodales en tareas abiertas en Ubuntu, Windows y macOS.

  • El benchmark incluye 369 tareas informáticas derivadas de casos de uso del mundo real que involucran aplicaciones web y de escritorio, E/S de archivos y flujos de trabajo multiaplicación.
  • Cada tarea cuenta con una configuración detallada del estado inicial y scripts de evaluación basados en la ejecución para una valoración fiable.
  • Las evaluaciones de agentes LLM/VLM de última generación muestran deficiencias significativas, con el mejor modelo logrando solo un 12,24% de éxito en comparación con el rendimiento humano superior al 72,36%.
  • Las principales dificultades identificadas son la fundamentación de la GUI y el conocimiento operativo.

Este benchmark proporciona un entorno unificado para evaluar la escalabilidad de los agentes y ofrece perspectivas para desarrollar agentes generalistas multimodales que los benchmarks anteriores no podían apoyar.