Исследователи представляют OSWorld, первую масштабируемую реальную компьютерную среду, предназначенную для оценки мультимодальных агентов на задачах с открытым концом в Ubuntu, Windows и macOS.

  • Бенчмарк включает 369 компьютерных задач, полученных из реальных сценариев использования, включающих веб- и десктопные приложения, файловый ввод/вывод и многоприкладные рабочие процессы.
  • Каждая задача содержит подробную настройку начального состояния и пользовательские скрипты оценки на основе выполнения для надежной проверки.
  • Оценка агентов на базе современных LLM/VLM показывает значительные недостатки: лучшая модель достигает успеха лишь в 12,24% случаев по сравнению с человеческой производительностью более 72,36%.
  • Основные выявленные проблемы — это привязка к графическому интерфейсу (GUI grounding) и операционные знания.

Этот бенчмарк предоставляет единую среду для оценки масштабируемости агентов и дает представление о разработке мультимодальных универсальных агентов, которые предыдущие бенчмарки не могли поддержать.