ZhiPub présente GLM-5.3-Flash, le premier modèle nativement multimodal de la série GLM-5, doté d'une architecture hybride combinant l'attention sparse et linéaire pour réduire les coûts de service de contexte long tout en préservant la précision.
Le modèle utilise 320 milliards de paramètres au total, dont seulement 18 milliards sont actifs, atteignant des performances qui dépassent GLM-5.2 sur les benchmarks et approchent Claude Opus 4.8 sur les tâches de codage à un dixième du prix. Les innovations techniques clés incluent les Hyper-Connections sous contrainte de variété (mHC) pour améliorer l'efficacité de mise à l'échelle et un modèle de base nouvellement entraîné optimisé autour des capacités et de l'efficacité.
GLM-5.3-Flash est disponible via la plateforme API Z.ai et prend en charge le déploiement via des frameworks tels que SGLang, vLLM, TokenSpeed, KTransformers et HLE.