Zai a présenté GLM-5.3-Flash, le premier modèle nativement multimodal de la série GLM-5. Il dispose d'une architecture hybride combinant l'attention clairsemée et linéaire pour réduire les coûts de service des contextes longs tout en maintenant des capacités précises.
- Le modèle possède 320B de paramètres au total, dont seulement 18B sont actifs.
- Il surpasse GLM-5.2 dans les benchmarks à un dixième du prix.
- Les performances approchent celles de Claude Opus 4.8 sur les benchmarks de codage et d'agents.
- Utilise Manifold-Constrained Hyper-Connections (mHC) pour améliorer l'efficacité de mise à l'échelle.
- Entraîné sur un corpus multimodal pré-entraîné de 30T tokens.
Le modèle est disponible via la Z.ai API Platform et prend en charge le déploiement avec SGLang, vLLM, TokenSpeed, KTransformers et HLE.