阿里巴巴集团的Qwen团队发布了详细阐述Qwen2.5-VL的技术报告,这是其视觉-语言系列中的最新旗舰模型。该报告概述了视觉识别、目标定位、文档解析和长视频理解方面的重大进展。

  • 该模型引入了动态分辨率处理和绝对时间编码,以处理不同大小的图像以及长达数小时的视频,并实现秒级事件定位。
  • 原生动态分辨率视觉Transformer (ViT) 结合窗口注意力机制,在保持原生分辨率的同时降低了计算开销。
  • 预训练语料库从1.2万亿个token扩展至4.1万亿个token,在不进行任务特定微调的情况下提升了跨领域性能。
  • 旗舰模型Qwen2.5-VL-72B的性能与GPT-4o和Claude 3.5 Sonnet等最先进模型相当,而较小的7B和3B变体在资源受限环境中优于竞争对手。

报告强调了该模型作为交互式视觉智能体的能力,可在计算机和移动设备上执行推理和任务。