Z.ai发布了GLM-5.3-Flash,这是一个拥有320B参数、18B激活参数的多模态MoE模型;而阿里巴巴的Qwen团队则发布了Qwen3.8-Flash-Next,这是一个拥有125B参数、6B激活参数的模型。尽管是独立开发,但两个团队采用了几乎相同的架构配置。

  • 两种模型均使用线性注意力和全注意力层的3:1混合结构,以平衡效率与精度。
  • 通过一个学习到的索引器将上下文压缩4倍,并将稀疏注意力的预算限制在2048个token。
  • 单个残差流被替换为四个并行的门控分支,以改善流量控制并减少内存开销。
  • 训练使用Muon优化器,融合投影矩阵在正交化之前被拆分为独立的变换。
  • 两个团队在位置编码上存在分歧:GLM放弃RoPE改用NoPE,而Qwen在NoPE变体未能阻止训练后生成内容后保留了RoPE。

这种收敛表明行业在高效长上下文建模方面存在共同方向,尽管MiniMax因推理缺陷拒绝线性注意力而持反对意见。