Este artigo apresenta o UI-TARS, um modelo de agente de GUI nativo de ponta a ponta que percebe capturas de tela como entrada e realiza interações de teclado e mouse semelhantes às humanas, sem depender de modelos comerciais encapsulados.

  • Alcança desempenho de estado da arte em mais de 10 benchmarks de agentes de GUI que avaliam percepção, fundamentação e execução de tarefas.
  • Obtém pontuação de 24,6 com 50 etapas e 22,7 com 15 etapas no benchmark OSWorld, superando o Claude (22,0 e 14,9, respectivamente).
  • Alcança pontuação de 46,6 no AndroidWorld, superando os 34,5 do GPT-4o.
  • Incorpora percepção aprimorada por meio de conjuntos de dados em larga escala de capturas de tela de GUI para legendagem precisa.
  • Utiliza modelagem unificada de ações para padronizar ações entre plataformas e alcançar fundamentação precisa.
  • Implementa Raciocínio System-2 para tomada de decisão em múltiplas etapas, incluindo decomposição de tarefas e reflexão.
  • Usa treinamento iterativo com rastros online reflexivos coletados de centenas de máquinas virtuais para abordar gargalos de dados.

Os autores analisam o caminho de evolução dos agentes de GUI para orientar o desenvolvimento futuro neste domínio, demonstrando que modelos nativos podem superar frameworks sofisticados dependentes de prompts elaborados por especialistas.