阿里巴巴发布了其最大开源模型 Qwen3.8-2.4T-A95B(也称为 Qwen3.8-Max)的开源权重,旨在为开放生态带来接近前沿的能力。
- 该模型拥有 2.4 万亿总参数,每个 token 激活 950 亿参数。
- 它采用了细粒度混合专家 (MoE) 架构,并结合了全注意力与线性注意力的混合机制。
- 此次发布强调了在 NVIDIA GB300 NVL72 硬件上部署该大规模模型的能力。
阿里巴巴发布了其最大开源模型 Qwen3.8-2.4T-A95B(也称为 Qwen3.8-Max)的开源权重,旨在为开放生态带来接近前沿的能力。