Zhipu AI a lancé le modèle GLM-5.3-Flash, le positionnant comme une solution d'intelligence de pointe avec des capacités d'inférence à faible coût.
Zhipu AI lance GLM-5.3-Flash
NVIDIA rachète HuggingFace pour 13 milliards de dollars ; Z.ai lance GLM-5.3-Flash
Nvidia acquiert HuggingFace pour 13 milliards de dollars, près du double de son offre initiale de janvier 2026, alors que la plateforme double sa base de clients en 2026. Parallèlement, Z.ai a officiellement lancé GLM-5.3-Flash, un modèle open-weight nativement multimodal précédemment connu sous le nom d'Ox Alpha.
Z.ai lance GLM-5.3-Flash, un modèle multimodal de 320 milliards de paramètres avec une fenêtre de contexte de 1 million
Z.ai a officiellement lancé GLM-5.3-Flash, révélant que le modèle précédemment présenté sous le nom « Ox Alpha » est son identité publique. Le modèle comporte 320 milliards de paramètres au total dont 18 milliards actifs, une fenêtre de contexte de 1 million de tokens et des capacités multimodales natives.
Z.ai publie GLM-5.3-Flash, un MoE multimodal 320B-A18B avec une fenêtre de contexte de 1M
Z.ai a publié GLM-5.3-Flash, le premier modèle nativement multimodal de la série GLM-5, utilisant une architecture mixture-of-experts avec 320 milliards de paramètres au total et 18 milliards actifs par token. Le modèle prend en charge les entrées d'images et de vidéos dans une fenêtre de contexte de 1 048 576 tokens et est disponible sous licence MIT sur Hugging Face.
Zai-org publie les poids de GLM-5.3 sur Hugging Face
L'organisation Zai a rendu disponibles les poids du modèle GLM-5.3 sur Hugging Face, conformément à une annonce précédente.
Zhipu AI publie GLM-5.3-Flash, un modèle open-weight multimodal
Zhipu AI a publié GLM-5.3-Flash, le premier modèle nativement multimodal de la série GLM-5 et la première version open-weight de l'architecture glm5_next. Le modèle à 320 milliards de paramètres est entraîné sur un corpus multimodal de 30 billions de tokens et intègre un mécanisme d'attention hybride combinant une attention linéaire et une attention creuse pour réduire les coûts de service sur des contextes longs.