연구진은 397B-A17B Qwen mixture-of-experts 백본을 기반으로 구축된 네이티브 컴퓨터 사용 에이전트인 Qwen-CUA를 소개했습니다. 이 시스템은 DOM 트리나 접근성 메타데이터에 의존하지 않고 스크린샷을 관찰하며 키보드 및 마우스 이벤트를 통해 작동합니다.
- 최신 증거를 유지하기 위해 최대 20개의 활성 스크린샷을 유지하고, 이전 시각적 기록을 고정 크기 블록으로 압축합니다.
- 훈련에는 거의 100,000개의 vCPU와 약 40,000개의 검증 가능한 작업을 갖춘 클라우드 롤아웃 군집이 활용되었습니다.
- Qwen-CUA는 여덟 가지 벤치마크에서 Qwen3.7을 능가하며 OSWorld-Verified에서 86.2점, OSWorld 2.0의 이진/부분 완료에서 각각 18.5/48.4점을 달성했습니다.
- 이 접근 방식을 1조 개 이상의 파라미터로 확장하면 Qwen-CUA-Max가 생성되어 점수가 각각 87.6과 21.2/53.3으로 향상됩니다.
- 이 모델은 Qwen3.7 대비 RedTeamCUA 공격 성공률을 36.6에서 16.4로 낮춥니다.
이러한 결과는 네이티브 컴퓨터 사용이 광범위한 능력을 갖춘 에이전트 기반임을 입증하며, 확장 가능한 검증 가능한 상호작용과 하이브리드 도구 사용을 주요 방향으로 강조합니다.