阿里云推出了Qwen3.8-Omni-Flash,这是一款原生的多模态智能体模型,专为现实世界的生产力任务设计,与之前的全模态模型相比,大幅提升了多模态理解和推理能力。
该模型继承了来自Qwen3.8-Next的稀疏混合专家(sparse mixture-of-experts)架构,并将上下文窗口扩展至一百万个token,以支持长上下文多模态推理和长期规划。它采用原生多模态联合训练策略,在保持强大文本领域能力的同时,促进智能体能力向音频和视频任务的迁移。
为了支持部署,团队发布了用于多模态生产力的Qwen-MM-Plugins和用于构建响应式、实时多模态智能体的Qwen-Live-Harness。这些工具使得将模型集成到视频编辑、长文本翻译和音乐条件生成等应用的生产工作流中成为可能。