Z.ai 发布了 GLM-5.3-Flash,这是 GLM-5 系列中首个原生多模态模型,采用混合专家架构,总参数量为 3200 亿,每个 token 激活 180 亿参数。该模型支持在 1,048,576 个 token 的上下文窗口内处理图像和视频输入,并在 Hugging Face 上以 MIT 许可证开源。
- 它采用混合注意力机制,将 KDA 线性注意力层与 NoPE 稀疏 MLA 层相结合,通过 288 个专家中的 8 个进行路由。
- IndexPool 机制将注意力计算量减少了约 3 倍,并将 KV 缓存缩小了 4.4 倍(相较于 GLM-5.3)。
- 基准测试显示其在 Terminal-Bench 2.1 上得分为 84.3,在 DeepSWE v1.1 上得分为 63.4,表现接近 Claude Opus 4.8。
- API 定价为输入 token 每百万 0.15 美元,输出 token 每百万 0.50 美元;自托管需要约 306 GiB 的 FP8 权重。
该模型旨在提供具有成本效益的代码解决方案,据报道其在基准测试中超越了 GLM-5.2,价格仅为后者的十分之一左右,同时在内部编码任务上保持了高性能。