阿里巴巴发布了 Qwen3.8-Flash-Next 模型权重,作为即将推出的 Qwen4 架构的预览,供开发者进行实验和评估。

  • 该模型是一个多模态混合专家(MoE)模型,总参数量为 176B,其中包括 51B 的 N-gram 嵌入参数。
  • 它在保持原生 262,144 个 token 上下文窗口的同时,每个 token 激活 6B 个参数。
  • 使用 YaRN 可将上下文窗口扩展至 1M 个 token。

此次发布允许开发者在 Qwen4 正式推出之前评估新架构在智能体编程任务中的能力。