Z.ai a publié GLM-5.3-Flash, un modèle MoE multimodal de 320 milliards de paramètres avec 18 milliards de paramètres actifs, tandis que l'équipe Qwen d'Alibaba a publié Qwen3.8-Flash-Next, un modèle de 125 milliards avec 6 milliards de paramètres actifs. Malgré un développement indépendant, les deux équipes ont adopté des configurations architecturales quasi identiques.
- Les deux modèles utilisent une hybridation 3:1 de couches d'attention linéaire et complète pour équilibrer efficacité et précision.
- Le contexte est compressé par un facteur de 4 via un indexeur appris qui limite le budget d'attention sparse à 2048 tokens.
- Le flux résiduel unique est remplacé par quatre branches parallèles à gating pour améliorer le contrôle du flux et réduire la surcharge mémoire.
- L'entraînement utilise l'optimiseur Muon avec des matrices de projection fusionnées divisées en transformations indépendantes avant l'orthogonalisation.
- Les équipes divergent sur l'encodage positionnel : GLM abandonne RoPE pour NoPE, tandis que Qwen a conservé RoPE après que les variantes NoPE ont échoué à arrêter la génération post-entraînement.
Cette convergence suggère une direction industrielle partagée pour la modélisation de contexte long efficace, bien que MiniMax reste un dissident en rejetant l'attention linéaire en raison de déficits de raisonnement.