微软发布了Mage-VL,这是一种高效的4B参数多模态基础模型,用于图像和视频理解,采用编解码器原生的方法来简化视觉处理。该系统将视频流分离为关键帧(I帧)和预测帧(P帧),仅保留编解码器分配比特的补丁,从而将视觉标记的消耗减少超过75%。

  • Mage-VL将从头构建的Codec-ViT视觉编码器与Qwen3-4B因果解码语言主干相结合。
  • 该架构在保持时空上下文的同时,实现了高达3.5倍的墙钟推理加速,优于均匀帧采样方法。
  • 系统1与系统2的双过程设计增加了主动流式传输功能,利用轻量级认知门控仅在必要时调用完整的VLM。
  • 在视频基准测试中,Mage-VL在所有报告的指标上均优于Qwen3-VL-4B,在高度依赖定位的任务(如QVHighlight)中取得了显著的提升,得分提高了22.5。

该模型旨在平衡复杂的离线推理与实时流式感知,为低延迟事件门控评论提供单模型解决方案。