Z.ai a officiellement lancé GLM-5.3-Flash, révélant que le modèle précédemment présenté sous le nom « Ox Alpha » est son identité publique. Le modèle comporte 320 milliards de paramètres au total dont 18 milliards actifs, une fenêtre de contexte de 1 million de tokens et des capacités multimodales natives.

  • Publiée sous la licence MIT, elle est disponible via les poids sur Hugging Face, l'API, le chat et les plans de codage.
  • Z.ai affirme qu'il surpasse GLM-5.2 à chaque niveau d'effort et égale Claude Opus 4.8 sur les benchmarks de codage.
  • Artificial Analysis rapporte un score d'indice d'intelligence de 57, égalant GPT-5.6 Terra et Muse Spark 1.2 mais à un coût significativement inférieur.
  • L'architecture utilise une attention hybride de style Kimi Linear, des chemins résiduels de type DeepSeek V4 et s'exécute entièrement sur des puces IA chinoises.
  • Un support infrastructurel précoce est apparu chez CoreWeave et Baseten, avec une correction de modèle de prompt publiée peu après le lancement.

Le lancement positionne GLM-5.3-Flash comme une option hautement compétitive en termes de prix pour la génération de code et les tâches agentic, bien que des évaluations indépendantes suggèrent qu'il pourrait être moins précis sur les connaissances factuelles générales par rapport à ses performances de raisonnement.