Makalah ini memperkenalkan UI-TARS, sebuah model agen GUI asli end-to-end yang mempersepsikan tangkapan layar sebagai input dan melakukan interaksi keyboard serta mouse layaknya manusia tanpa bergantung pada model komersial yang dibungkus.

  • Mencapai kinerja state-of-the-art di lebih dari 10 benchmark agen GUI yang mengevaluasi persepsi, grounding, dan eksekusi tugas.
  • Meraih skor 24.6 dengan 50 langkah dan 22.7 dengan 15 langkah pada benchmark OSWorld, mengungguli Claude (masing-masing 22.0 dan 14.9).
  • Mencapai skor 46.6 di AndroidWorld, melampaui skor GPT-4o sebesar 34.5.
  • Mengintegrasikan persepsi yang ditingkatkan melalui dataset tangkapan layar GUI skala besar untuk kaptingan yang presisi.
  • Memanfaatkan pemodelan aksi terunifikasi untuk menstandarkan aksi di berbagai platform dan mencapai grounding yang presisi.
  • Menerapkan System-2 Reasoning untuk pengambilan keputusan multi-langkah, termasuk dekomposisi tugas dan refleksi.
  • Menggunakan pelatihan iteratif dengan jejak online reflektif yang dikumpulkan dari ratusan mesin virtual untuk mengatasi kemacetan data.

Para penulis menganalisis jalur evolusi agen GUI untuk membimbing pengembangan lebih lanjut di domain ini, menunjukkan bahwa model asli dapat mengungguli kerangka kerja canggih yang bergantung pada prompt buatan ahli.