阿里巴巴 Qwen 团队发布了 Qwen3.8-Omni-Flash,这是其首款围绕音频-视频理解和工具使用的智能体能力设计的多模态模型。该模型接受文本、图像、音频和视频输入,返回文本输出,具备 1M token 上下文窗口和原生函数调用功能。

  • 基于 Qwen3.8-Flash-Next 架构构建,提供 1M token 上下文,最大输入为 991K token,最大输出为 131K token。
  • 它采用针对长视频的智能体感知工作流,将 OmniVideoBench 准确率从 63.4 提升至 67.8,同时减少 45.7% 的 token 使用量。
  • 与 Qwen3.5-Omni-Plus 相比,该模型在性能上取得显著提升,在 29 项评估中的平均得分提高超过 25%。
  • 可通过 QwenCloud、阿里云 Model Studio 和 Qwen Studio 的 API 获取,定价为每 1M 输入 token $0.15,每 1M 输出 token $0.47。
  • 团队还以 Apache-2.0 许可证开源了 Qwen-MM-Plugins,以支持多模态智能体框架。

此次发布为涉及长音频和视频分析的复杂智能体工作流提供了托管解决方案,据报道,与之前的模型相比,音视频输入的成本降低了超过 93%。