यह पेपर UI-TARS का परिचय देता है, एक एंड-टू-एंड स्थानीय GUI एजेंट मॉडल जो इनपुट के रूप में स्क्रीनशॉट को संवेदनशीलता से देखता है और किसी भी लिपटे हुए व्यापारिक मॉडल पर निर्भर किए बिना मानव जैसी कीबोर्ड और माउस इंटरैक्शन करता है।

  • 10+ GUI एजेंट बेंचमार्क्स में, जो संवेदनशीलता, ग्राउंडिंग और कार्य निष्पादन का मूल्यांकन करते हैं, शीर्ष प्रदर्जन प्राप्त करता है।
  • OSWorld बेंचमार्क पर 50 स्टेप्स के साथ 24.6 और 15 स्टेप्स के साथ 22.7 अंक हासिल करता है, जो Claude (क्रमशः 22.0 और 14.9) को पछाड़ता है।
  • AndroidWorld में 46.6 का स्कोर प्राप्त करता है, जो GPT-4o के 34.5 से आगे है।
  • सटीक कैप्शनिंग के लिए बड़े पैमाने पर GUI स्क्रीनशॉट डेटासेट के माध्यम से बढ़ी हुई संवेदनशीलता को शामिल करता है।
  • प्लेटफार्मों भर में कार्यों को मानकीकृत करने और सटीक ग्राउंडिंग प्राप्त करने के लिए एकीकृत एक्शन मॉडलिंग का उपयोग करता है।
  • कार्य विभाजन और प्रतिबिंब सहित बहु-चयनीय निर्णय लेने के लिए सिस्टम-2 तर्कशीलता को लागू करता है।
  • डेटा बाधाओं को दूर करने के लिए सैकड़ों वर्चुअल मशीनों से एकत्रित प्रतिबिंबी ऑनलाइन ट्रेस के साथ पुनरावृत्त प्रशिक्षण का उपयोग करता है।

लेखकों ने इस डोमेन में आगे की विकास को मार्गदर्शन करने के लिए GUI एजेंटों के विकास पथ का विश्लेषण किया है, यह दिखाते हुए कि स्थानीय मॉडल विशेषज्ञ-निर्मित प्रॉम्प्ट्स पर निर्भर जटिल फ्रेमवर्कों से बेहतर प्रदर्शन कर सकते हैं।