Исследователи представляют OSWorld, первую масштабируемую реальную компьютерную среду, предназначенную для оценки мультимодальных агентов на задачах с открытым концом в Ubuntu, Windows и macOS.
- Бенчмарк включает 369 компьютерных задач, полученных из реальных сценариев использования, включающих веб- и десктопные приложения, файловый ввод/вывод и многоприкладные рабочие процессы.
- Каждая задача содержит подробную настройку начального состояния и пользовательские скрипты оценки на основе выполнения для надежной проверки.
- Оценка агентов на базе современных LLM/VLM показывает значительные недостатки: лучшая модель достигает успеха лишь в 12,24% случаев по сравнению с человеческой производительностью более 72,36%.
- Основные выявленные проблемы — это привязка к графическому интерфейсу (GUI grounding) и операционные знания.
Этот бенчмарк предоставляет единую среду для оценки масштабируемости агентов и дает представление о разработке мультимодальных универсальных агентов, которые предыдущие бенчмарки не могли поддержать.