L'équipe Qwen d'Alibaba a publié Qwen3.8-Flash-Next, un modèle multimodal à experts mélangés (Mixture-of-Experts) à poids ouverts conçu pour anticiper l'architecture de la future série Qwen4. Le point de contrôle associe une colonne vertébrale de 125B à une table d'embeddings N-gram de 51B et un module de prédiction multi-jeton de 4B, n'activant que 6B de paramètres par jeton.
- Architecture : Utilise un hybride de Gated DeltaNet (attention linéaire) pour trois des quatre couches et de Qwen Sparse Attention pour la quatrième, ainsi que des flux résiduels à porte et l'optimiseur Muon.
- Benchmarks : Obtient 58.7 sur DeepSWE 1.1, 62.5 sur SWE-bench Pro, 91.9 sur LiveCodeBench v6 et 95.7 sur MathVision avec interpréteur de code.
- Efficacité : Le coût d'entraînement est d'environ un neuvième celui de Qwen3.7-Plus ; le déploiement montre une augmentation du débit de préremplissage jusqu'à 10,2x avec des taux de hit de cache de préfixe élevés.
- Contexte & Stockage : Prend en charge nativement 262 144 jetons (extensible à 1M via YaRN) ; le point de contrôle FP8 fait 172,78 GiB, nécessitant un déploiement multi-GPU.
Le modèle sert d'aperçu architectural précoce pour Qwen4, offrant des réductions de coûts et des améliorations de vitesse significatives tout en maintenant des performances compétitives sur les benchmarks de codage et de raisonnement.