Este artículo presenta UI-TARS, un modelo de agente de GUI nativo de extremo a extremo que percibe capturas de pantalla como entrada y realiza interacciones con teclado y ratón similares a las humanas sin depender de modelos comerciales envueltos.
- Logra el estado del arte en más de 10 benchmarks de agentes de GUI que evalúan percepción, fundamentación y ejecución de tareas.
- Obtiene una puntuación de 24.6 con 50 pasos y 22.7 con 15 pasos en el benchmark OSWorld, superando a Claude (22.0 y 14.9 respectivamente).
- Alcanza una puntuación de 46.6 en AndroidWorld, superando los 34.5 de GPT-4o.
- Incorpora percepción mejorada mediante conjuntos de datos de capturas de pantalla de GUI a gran escala para una descripción precisa.
- Utiliza modelado de acciones unificado para estandarizar las acciones entre plataformas y lograr una fundamentación precisa.
- Implementa Razonamiento System-2 para la toma de decisiones en múltiples pasos, incluyendo descomposición de tareas y reflexión.
- Usa entrenamiento iterativo con trazas online reflexivas recopiladas de cientos de máquinas virtuales para abordar los cuellos de botella de datos.
Los autores analizan la trayectoria evolutiva de los agentes de GUI para guiar el desarrollo futuro en este dominio, demostrando que los modelos nativos pueden superar marcos sofisticados dependientes de prompts elaborados por expertos.