智谱推出 GLM-5.3-Flash,这是 GLM-5 系列中首个原生多模态模型,采用混合架构,结合稀疏注意力和线性注意力,在保持精度的同时降低长上下文服务成本。

该模型使用 320B 总参数,其中仅 18B 为活跃参数,在基准测试中的性能超越 GLM-5.2,并在编码任务上接近 Claude Opus 4.8 的水平,而价格仅为后者的十分之一。关键技术创新包括用于提高扩展效率的流形约束超连接(Manifold-Constrained Hyper-Connections, mHC),以及围绕能力和效率优化的新训练基础模型。

GLM-5.3-Flash 可通过 Z.ai API 平台获取,并支持通过 SGLang、vLLM、TokenSpeed、KTransformers 和 HLE 等框架进行部署。