Z.AI a confirmé mercredi que le modèle Ox Alpha est une nouvelle itération de sa série GLM. L'entreprise a déclaré qu'elle publierait les poids du modèle plus tard dans la soirée, en réponse aux demandes de Bloomberg News.
Z.AI confirme qu'Ox Alpha est un nouveau modèle de la série GLM et publiera les poids
Z.ai lance GLM-5.3 avec un post-apprentissage étendu
Z.ai a annoncé GLM-5.3, un nouveau modèle qui atteint des performances de pointe sur les benchmarks de codification agentic en étendant le post-apprentissage de son modèle de base GLM-5.2. Le modèle de ~750B paramètres dépasse actuellement Kimi K3 et égale ou dépasse Claude Fable 5 et GPT-5.6-Sol sur divers benchmarks.
Kimi K3, DeepSeek V4 Pro et GLM-5.2 comparés sur les benchmarks, la licence et le coût de déploiement
Une comparaison de trois modèles Mixture-of-Experts à poids ouverts — Kimi K3 de Moonshot AI, DeepSeek V4 Pro et GLM-5.2 de Zhipu AI — évalue leurs capacités, leurs conditions de licence et leurs coûts de déploiement pour les charges de travail de codage et d'agents sur le long terme.
Z.AI confirme qu'Ox Alpha est un modèle GLM et prévoit de publier ses poids
Z.AI a confirmé que le modèle "Ox Alpha" récemment discuté fait partie de sa famille GLM. L'entreprise a également annoncé son intention de publier publiquement les poids du modèle.
GLM-5.3 égale la précision de Claude Fable 5 sur DeepSWE pour un cinquième du coût
Une comparaison entre GLM-5.3 et Claude Fable 5 sur le benchmark DeepSWE révèle que, bien que les deux modèles atteignent une précision au premier essai quasi identique (69,0 % contre 69,7 %), GLM-5.3 est nettement plus rentable et offre de meilleures performances dans les scénarios à multiples tentatives.
GLM-5.3 et GPT-5.6 Sol : la cascade résout 85,9 % des tâches DeepSWE à 6,61 $
Une analyse comparative de GLM-5.3 et GPT-5.6 Sol sur le benchmark DeepSWE révèle qu'une stratégie d'acheminement en cascade surpasse chaque modèle utilisé isolément. En exécutant GLM-5.3 en premier et en escaladant vers GPT-5.6 Sol uniquement lorsque les tests échouent, le système résout 85,9 % des tâches à 6,61 $ par tâche.