Z.ai a publié GLM-5.3-Flash, le premier modèle nativement multimodal de la série GLM-5, utilisant une architecture mixture-of-experts avec 320 milliards de paramètres au total et 18 milliards actifs par token. Le modèle prend en charge les entrées d'images et de vidéos dans une fenêtre de contexte de 1 048 576 tokens et est disponible sous licence MIT sur Hugging Face.
- Il utilise une attention hybride combinant des couches d'attention linéaire KDA avec des couches MLA éparse NoPE, acheminant les tokens à travers 8 experts sur 288.
- Un mécanisme IndexPool réduit le calcul d'attention d'environ 3x et diminue le cache KV de 4.4x par rapport à GLM-5.3.
- Les benchmarks montrent des scores de 84,3 sur Terminal-Bench 2.1 et 63,4 sur DeepSWE v1.1, le plaçant près de Claude Opus 4.8.
- Le prix de l'API est fixé à 0,15 $/M pour les tokens d'entrée et 0,50 $/M pour les tokens de sortie, avec une auto-hébergement nécessitant environ 306 GiB de poids FP8.
Le modèle vise à fournir une solution de codage rentable, battant reportedly GLM-5.2 sur les benchmarks à environ un dixième du prix tout en maintenant des performances élevées sur les tâches de codage internes.