본 논문은 스크린샷을 입력으로 인식하고 래핑된 상용 모델에 의존하지 않고 인간과 같은 키보드 및 마우스 상호작용을 수행하는 엔드투엔드 네이티브 GUI 에이전트 모델인 UI-TARS를 소개합니다.

  • 지각, 그라운딩 및 작업 실행을 평가하는 10개 이상의 GUI 에이전트 벤치마크에서 최상위 성능 달성.
  • OSWorld 벤치마크에서 50단계 시 24.6점, 15단계 시 22.7점을 기록하여 각각 22.0점과 14.9점을 기록한 Claude를 능가.
  • AndroidWorld에서 46.6점을 달성하여 GPT-4o의 34.5점을 상회.
  • 정밀한 캡셔닝을 위해 대규모 GUI 스크린샷 데이터셋을 통한 향상된 지각 통합.
  • 플랫폼 간 작업을 표준화하고 정밀한 그라운딩을 달성하기 위한 통합 작업 모델링 활용.
  • 작업 분해 및 반성을 포함한 다단계 의사 결정을 위한 System-2 추론 구현.
  • 수백 대의 가상 머신에서 수집된 반성형 온라인 트레이스를 사용한 반복 학습을 통해 데이터 병목 현상 해결.

저자들은 이 분야의 추가 개발을 안내하기 위해 GUI 에이전트의 진화 경로를 분석했으며, 네이티브 모델이 전문가가 제작한 프롬프트에 의존하는 정교한 프레임워크보다 우수한 성능을 낼 수 있음을 입증했습니다.