Zai ha presentado GLM-5.3-Flash, el primer modelo nativamente multimodal de la serie GLM-5. Cuenta con una arquitectura híbrida que combina atención dispersa y lineal para reducir los costos de servicio de contextos largos mientras mantiene capacidades precisas.
- El modelo tiene 320B parámetros totales con solo 18B parámetros activos.
- Supera a GLM-5.2 en benchmarks a una décima parte del precio.
- El rendimiento se acerca al de Claude Opus 4.8 en benchmarks de codificación y agentes.
- Utiliza Manifold-Constrained Hyper-Connections (mHC) para mejorar la eficiencia de escalado.
- Entrenado con un corpus multimodal preentrenado de 30T tokens.
El modelo está disponible a través de Z.ai API Platform y admite implementación con SGLang, vLLM, TokenSpeed, KTransformers y HLE.