В данной статье представлен UI-TARS — сквозная нативная модель GUI-агента, которая воспринимает скриншоты в качестве входных данных и выполняет взаимодействия с клавиатурой и мышью, похожие на человеческие, без опоры на обёрнутые коммерческие модели.

  • Демонстрирует состояние-of-the-art результаты на более чем 10 бенчмарках GUI-агентов, оценивающих восприятие, привязку (grounding) и выполнение задач.
  • Набирает 24.6 балла при 50 шагах и 22.7 балла при 15 шагах на бенчмарке OSWorld, превосходя Claude (22.0 и 14.9 соответственно).
  • Достигает результата 46.6 в AndroidWorld, превосходя показатель GPT-4o в 34.5.
  • Включает улучшенное восприятие за счёт крупномасштабных наборов данных скриншотов GUI для точного описания.
  • Использует унифицированное моделирование действий для стандартизации действий на разных платформах и достижения точной привязки.
  • Реализует рассуждение System-2 для принятия многошаговых решений, включая декомпозицию задач и рефлексию.
  • Применяет итеративное обучение с отражающими онлайн-трейсами, собранными со сотен виртуальных машин, для преодоления ограничений данных.

Авторы анализируют путь эволюции GUI-агентов, чтобы направлять дальнейшее развитие в этой области, демонстрируя, что нативные модели могут превосходить сложные фреймворки, зависящие от экспертно составленных промптов.