알리바바 그룹의 Qwen 팀은 비전-언어 시리즈의 최신 플래그십 모델인 Qwen2.5-VL에 대한 자세한 내용을 담은 기술 보고서를 발표했습니다. 이 보고서에서는 시각적 인식, 객체 국소화, 문서 파싱, 그리고 긴 영상 이해에서의 중요한 진전을 다루고 있습니다.
- 모델은 동적 해상도 처리와 절대 시간 인코딩을 도입하여 다양한 크기의 이미지와 초 단위 이벤트 국소화가 가능한 수 시간 길이의 영상을 처리합니다.
- 윈도우 어텐션을 갖춘 네이티브 동적 해상도 비전 트랜스포머(ViT)가 네이티브 해상도를 유지하면서 계산 오버헤드를 줄입니다.
- 사전 학습 코퍼스 토큰 수가 1.2조에서 4.1조로 확장되어 작업별 파인튜닝 없이 다양한 도메인 전반의 성능을 향상시켰습니다.
- 플래그십 Qwen2.5-VL-72B 모델은 GPT-4o 및 Claude 3.5 Sonnet과 같은 최첨단 모델과 동등한 성능을 보이며, 더 작은 7B 및 3B 변형 모델은 자원 제약 환경에서 경쟁사들을 능가합니다.
보고서는 이 모델이 컴퓨터와 모바일 기기에서 추론 및 작업 실행을 위한 상호작용형 시각 에이전트로서 역할을 할 수 있는 능력을 강조합니다.