El equipo de Qwen de Alibaba ha lanzado Qwen3.8-Flash-Next, un modelo Mixture-of-Experts multimodal de pesos abiertos diseñado para anticipar la arquitectura de la próxima serie Qwen4. El punto de control combina una columna vertebral de 125B con una tabla de incrustaciones N-gram de 51B y un módulo de predicción multi-token de 4B, activando solo 6B parámetros por token.
- Arquitectura: Utiliza una combinación de Gated DeltaNet (atención lineal) para tres de cada cuatro capas y Qwen Sparse Attention para la cuarta, junto con flujos residuales con compuerta y el optimizador Muon.
- Benchmarks: Alcanza 58.7 en DeepSWE 1.1, 62.5 en SWE-bench Pro, 91.9 en LiveCodeBench v6 y 95.7 en MathVision con intérprete de código.
- Eficiencia: El costo de entrenamiento es aproximadamente una novena parte del de Qwen3.7-Plus; el servicio muestra un aumento de hasta 10.2x en la tasa de prellenado a altas tasas de acierto de caché de prefijo.
- Contexto y Almacenamiento: Soporta nativamente 262,144 tokens (extensible a 1M mediante YaRN); el punto de control FP8 tiene 172.78 GiB, requiriendo un despliegue multi-GPU.
El modelo sirve como una vista previa arquitectónica temprana para Qwen4, ofreciendo reducciones significativas de costos y mejoras de velocidad mientras mantiene un rendimiento competitivo en benchmarks de codificación y razonamiento.