Los investigadores presentan OSWorld, el primer entorno informático real y escalable diseñado para evaluar agentes multimodales en tareas abiertas en Ubuntu, Windows y macOS.
- El benchmark incluye 369 tareas informáticas derivadas de casos de uso del mundo real que involucran aplicaciones web y de escritorio, E/S de archivos y flujos de trabajo multiaplicación.
- Cada tarea cuenta con una configuración detallada del estado inicial y scripts de evaluación basados en la ejecución para una valoración fiable.
- Las evaluaciones de agentes LLM/VLM de última generación muestran deficiencias significativas, con el mejor modelo logrando solo un 12,24% de éxito en comparación con el rendimiento humano superior al 72,36%.
- Las principales dificultades identificadas son la fundamentación de la GUI y el conocimiento operativo.
Este benchmark proporciona un entorno unificado para evaluar la escalabilidad de los agentes y ofrece perspectivas para desarrollar agentes generalistas multimodales que los benchmarks anteriores no podían apoyar.