智谱AI发布了GLM-5.3-Flash,这是GLM-5系列中首个原生多模态模型,也是glm5_next架构的首个开源权重版本。该模型拥有320B参数,在包含30T token的多模态语料库上训练,并采用混合稀疏和线性注意力机制以降低长上下文推理成本。
- 架构:45层结构结合KDA线性注意力和DeepSeek风格的稀疏注意力,利用流形约束超连接(mHC)提升扩展效率。
- 多模态能力:24层ViT编码器允许图像和视频token进入词表,支持长达1,048,576 token的上下文长度。
- 权重格式:在Hugging Face和ModelScope上提供FP8 (e4m3)和BF16格式,采用MIT许可证。
- 推理支持:为vLLM和SGLang提供官方配置方案,包括推测解码配置。
此次发布旨在提供一种高性价比的替代方案,在编码和智能体基准测试中接近Claude Opus 4.8的性能,同时显著降低推理成本。