알리바바의 Qwen 팀은 이전 비전-언어 모델의 업그레이드인 Qwen2-VL 시리즈를 소개합니다. 이 시리즈는 고정 해상도 처리를 Naive Dynamic Resolution 메커니즘으로 대체하여 입력 해상도에 따라 시각적 토큰을 동적으로 조정하고 세부 사항 포착을 개선하며 인간의 지각 과정과 일치시킵니다.
- 이 시리즈에는 2B, 8B, 72B 파라미터를 가진 오픈 웨이트 모델이 포함됩니다.
- 멀티모달 회전 위치 임베딩(M-RoPE) 통합은 텍스트, 이미지 및 비디오 간 위치 정보를 융합합니다.
- Qwen2-VL-72B는 멀티모달 벤치마크에서 GPT-4o 및 Claude 3.5 Sonnet과 비교 가능한 성능을 달성했습니다.
- 아키텍처는 긴 지속 시간의 비디오 이해와 다국어 이미지 텍스트 이해를 지원합니다.
이 모델들은 복잡한 추론 작업에 대해 효율적인 시각적 표현을 제공하면서 다양한 규모에서 경쟁력 있는 성능을 유지하는 것을 목표로 합니다.