Zai推出了GLM-5.3-Flash,这是GLM-5系列中首个原生多模态模型。它采用混合架构,结合稀疏和线性注意力机制,在保持精确能力的同时降低长上下文的服务成本。

  • 该模型共有320B参数,其中仅有18B为激活参数。
  • 在基准测试中表现优于GLM-5.2,价格仅为十分之一。
  • 在编码和智能体基准测试中的性能接近Claude Opus 4.8。
  • 使用流形约束超连接(mHC)以提高扩展效率。
  • 基于30T token的多模态预训练语料库进行训练。

该模型可通过Z.ai API Platform获取,并支持使用SGLang、vLLM、TokenSpeed、KTransformers和HLE进行部署。