阿里巴巴Qwen团队推出Qwen2-VL系列,这是对先前视觉-语言模型的升级,用Naive Dynamic Resolution机制取代了固定分辨率处理。这使得模型能够根据输入分辨率动态调整视觉token,提高细节捕捉能力,并与人类感知过程保持一致。
- 该系列包含具有2B、8B和72B参数的开源权重模型。
- 多模态旋转位置嵌入(M-RoPE)的集成融合了文本、图像和视频中的位置信息。
- Qwen2-VL-72B在多模态基准测试中达到了与GPT-4o和Claude 3.5 Sonnet相当的性能。
- 该架构支持长时视频理解和多语言图像文本理解。
这些模型旨在为复杂推理任务提供高效的视觉表示,同时在各种规模上保持具有竞争力的性能。