ZhiPu presenta GLM-5.3-Flash, el primer modelo nativamente multimodal de la serie GLM-5, que cuenta con una arquitectura híbrida que combina atención dispersa y lineal para reducir los costos de servicio de contexto largo mientras preserva la precisión.

El modelo utiliza 320B parámetros totales con solo 18B parámetros activos, logrando un rendimiento que supera a GLM-5.2 en benchmarks y se acerca a Claude Opus 4.8 en tareas de codificación a una décima parte del precio. Las innovaciones técnicas clave incluyen Manifold-Constrained Hyper-Connections (mHC) para mejorar la eficiencia de escalado y un modelo base recién entrenado optimizado alrededor de capacidades y eficiencia.

GLM-5.3-Flash está disponible a través de la Plataforma API de Z.ai y admite implementación a través de marcos como SGLang, vLLM, TokenSpeed, KTransformers y HLE.