В данной статье представлен UI-TARS — сквозная нативная модель GUI-агента, которая воспринимает скриншоты в качестве входных данных и выполняет взаимодействия с клавиатурой и мышью, похожие на человеческие, без опоры на обёрнутые коммерческие модели.
- Демонстрирует состояние-of-the-art результаты на более чем 10 бенчмарках GUI-агентов, оценивающих восприятие, привязку (grounding) и выполнение задач.
- Набирает 24.6 балла при 50 шагах и 22.7 балла при 15 шагах на бенчмарке OSWorld, превосходя Claude (22.0 и 14.9 соответственно).
- Достигает результата 46.6 в AndroidWorld, превосходя показатель GPT-4o в 34.5.
- Включает улучшенное восприятие за счёт крупномасштабных наборов данных скриншотов GUI для точного описания.
- Использует унифицированное моделирование действий для стандартизации действий на разных платформах и достижения точной привязки.
- Реализует рассуждение System-2 для принятия многошаговых решений, включая декомпозицию задач и рефлексию.
- Применяет итеративное обучение с отражающими онлайн-трейсами, собранными со сотен виртуальных машин, для преодоления ограничений данных.
Авторы анализируют путь эволюции GUI-агентов, чтобы направлять дальнейшее развитие в этой области, демонстрируя, что нативные модели могут превосходить сложные фреймворки, зависящие от экспертно составленных промптов.