Cet article présente UI-TARS, un modèle d'agent GUI natif de bout en bout qui perçoit les captures d'écran en entrée et effectue des interactions clavier et souris de type humain sans dépendre de modèles commerciaux encapsulés.
- Atteint des performances de pointe sur plus de 10 benchmarks d'agents GUI évaluant la perception, l'ancrage et l'exécution de tâches.
- Marque 24,6 avec 50 étapes et 22,7 avec 15 étapes sur le benchmark OSWorld, surpassant Claude (22,0 et 14,9 respectivement).
- Atteint un score de 46,6 dans AndroidWorld, dépassant les 34,5 de GPT-4o.
- Intègre une perception améliorée via des ensembles de données de captures d'écran GUI à grande échelle pour une légendage précis.
- Utilise la modélisation unifiée des actions pour standardiser les actions entre plateformes et atteindre un ancrage précis.
- Implémente le Raisonnement System-2 pour la prise de décision multi-étapes, incluant la décomposition de tâches et la réflexion.
- Utilise un entraînement itératif avec des traces en ligne réfléchies collectées à partir de centaines de machines virtuelles pour résoudre les goulots d'étranglement de données.
Les auteurs analysent le chemin d'évolution des agents GUI pour guider le développement futur dans ce domaine, démontrant que les modèles natifs peuvent surpasser des frameworks sophistiqués dépendants de prompts conçus par des experts.