inclusionAI 发布了开源模型 Ling-3.0-flash-VL,该模型通过原生图像和视频理解能力,扩展了其前身的语言和理解推理能力。
该模型拥有 124B 参数,每个 token 仅激活 5.5B 参数,并支持高达 1M token 的上下文窗口。其架构包括通过 MLP 投影器对齐的 ViT 视觉编码器、用于时间编码的 VideoRoPE,以及交替使用 KDA 和 Gated MLA 层的混合主干。
该设计将视觉信息整合到现实世界推理和智能体工作流中,同时通过稀疏专家混合(Mixture of Experts)保持推理效率。