Zhipu AI a publié GLM-5.3-Flash, le premier modèle nativement multimodal de la série GLM-5 et la première version open-weight de l'architecture glm5_next. Le modèle à 320 milliards de paramètres est entraîné sur un corpus multimodal de 30 billions de tokens et intègre un mécanisme d'attention hybride combinant une attention linéaire et une attention creuse pour réduire les coûts de service sur des contextes longs.
- Architecture : 45 couches combinant l'attention linéaire KDA avec une attention creuse de type DeepSeek, utilisant des Hyper-Conections à contrainte de variété (mHC) pour optimiser l'efficacité du passage à l'échelle.
- Capacités multimodales : Un encodeur ViT à 24 couches permet d'inclure des tokens d'image et de vidéo dans le vocabulaire, supportant une longueur de contexte allant jusqu'à 1 048 576 tokens.
- Poids disponibles : Formats FP8 (e4m3) et BF16 accessibles sur Hugging Face et ModelScope sous licence MIT.
- Support de l'inférence : Recettes officielles fournies pour vLLM et SGLang, incluant des configurations de décodage spéculatif.
Cette publication vise à offrir une alternative économique dont les performances se rapprochent de celles de Claude Opus 4.8 sur les benchmarks de codage et d'agents, tout en réduisant significativement les coûts d'inférence.