Zai a présenté GLM-5.3-Flash, le premier modèle nativement multimodal de la série GLM-5. Il dispose d'une architecture hybride combinant l'attention clairsemée et linéaire pour réduire les coûts de service des contextes longs tout en maintenant des capacités précises.

  • Le modèle possède 320B de paramètres au total, dont seulement 18B sont actifs.
  • Il surpasse GLM-5.2 dans les benchmarks à un dixième du prix.
  • Les performances approchent celles de Claude Opus 4.8 sur les benchmarks de codage et d'agents.
  • Utilise Manifold-Constrained Hyper-Connections (mHC) pour améliorer l'efficacité de mise à l'échelle.
  • Entraîné sur un corpus multimodal pré-entraîné de 30T tokens.

Le modèle est disponible via la Z.ai API Platform et prend en charge le déploiement avec SGLang, vLLM, TokenSpeed, KTransformers et HLE.