阿里巴巴Qwen团队发布了Qwen3.8-Flash-Next,这是一个开源权重的多模态混合专家模型,旨在预览即将推出的Qwen4系列架构。该检查点将125B主干与51B N-gram嵌入表和4B多令牌预测模块配对,每个令牌仅激活6B参数。
- 架构:使用门控DeltaNet(线性注意力)与前四层中的三层混合,以及第四层的Qwen稀疏注意力,同时结合门控残差流和Muon优化器。
- 基准测试:在DeepSWE 1.1上达到58.7分,在SWE-bench Pro上达到62.5分,在LiveCodeBench v6上达到91.9分,在MathVision(带代码解释器)上达到95.7分。
- 效率:训练成本约为Qwen3.7-Plus的九分之一;在服务方面,在高前缀缓存命中率下,预填充吞吐量最高提升10.2倍。
- 上下文与存储:原生支持262,144个令牌(可通过YaRN扩展至1M);FP8检查点大小为172.78 GiB,需要多GPU部署。
该模型作为Qwen4的早期架构预览,在保持编码和推理基准测试中具有竞争力的性能的同时,提供了显著的成本降低和速度提升。