DeepSeek a publié le checkpoint du modèle DeepSeek-V4-Flash-Vision-Exp sur Hugging Face. Le dépôt est désormais accessible au public.
DeepSeek publie DeepSeek-V4-Flash-Vision-Exp sur Hugging Face
Thinking Machines lance Inkling, Tencent met à jour Hy3 avec la licence Apache 2.0
Le dernier tour d'horizon des artefacts de modèles ouverts met en avant les lancements significatifs de Thinking Machines et Tencent, ainsi que les mises à jour de Poolside et DeepSeek.
Thinking Machines Lab publie le modèle fondamental Inkling en poids ouverts
Thinking Machines Lab a lancé Inkling, sa première famille de modèles fondamentaux entièrement publiée en poids ouverts. Présenté comme un modèle de base multimodale personnalisable plutôt que comme un modèle phare optimisé pour les benchmarks, Inkling prend en charge les entrées textuelles, image et audio avec une multimodalité native.
L'équipe Qwen d'Alibaba publie Qwen3.8-Flash-Next, une version préliminaire de 125B anticipant Qwen4
L'équipe Qwen d'Alibaba a publié Qwen3.8-Flash-Next, un modèle multimodal à experts mélangés (Mixture-of-Experts) à poids ouverts conçu pour anticiper l'architecture de la future série Qwen4. Le point de contrôle associe une colonne vertébrale de 125B à une table d'embeddings N-gram de 51B et un module de prédiction multi-jeton de 4B, n'activant que 6B de paramètres par jeton.
Zhipu AI publie GLM-5.3-Flash, un modèle open-weight multimodal
Zhipu AI a publié GLM-5.3-Flash, le premier modèle nativement multimodal de la série GLM-5 et la première version open-weight de l'architecture glm5_next. Le modèle à 320 milliards de paramètres est entraîné sur un corpus multimodal de 30 billions de tokens et intègre un mécanisme d'attention hybride combinant une attention linéaire et une attention creuse pour réduire les coûts de service sur des contextes longs.
ZhiPub publie GLM-5.3-Flash, un modèle multimodal de 320 milliards de paramètres
ZhiPub présente GLM-5.3-Flash, le premier modèle nativement multimodal de la série GLM-5, doté d'une architecture hybride combinant l'attention sparse et linéaire pour réduire les coûts de service de contexte long tout en préservant la précision.