A equipe Qwen da Alibaba lançou o Qwen3.8-Flash-Next, um modelo Mixture-of-Experts multimodal de pesos abertos projetado para antecipar a arquitetura da próxima série Qwen4. O checkpoint combina uma base de 125B com uma tabela de embeddings N-gram de 51B e um módulo de previsão multi-token de 4B, ativando apenas 6B de parâmetros por token.
- Arquitetura: Utiliza uma combinação de Gated DeltaNet (atenção linear) para três das quatro camadas e Qwen Sparse Attention para a quarta, juntamente com fluxos residuais com gate e otimizador Muon.
- Benchmarks: Alcançou 58.7 no DeepSWE 1.1, 62.5 no SWE-bench Pro, 91.9 no LiveCodeBench v6 e 95.7 no MathVision com interpretador de código.
- Eficiência: O custo de treinamento é aproximadamente um nono do Qwen3.7-Plus; o serviço mostra aumento de até 10,2x na taxa de preenchimento (prefill) em altas taxas de acerto de cache de prefixo.
- Contexto e Armazenamento: Suporta nativamente 262.144 tokens (extensível a 1M via YaRN); o checkpoint FP8 tem 172,78 GiB, exigindo implantação em múltiplas GPUs.
O modelo serve como uma prévia arquitetural inicial do Qwen4, oferecendo reduções significativas de custo e melhorias de velocidade enquanto mantém desempenho competitivo em benchmarks de codificação e raciocínio.