Alibaba ha publicado los pesos del modelo Qwen3.8-Flash-Next, que sirven como una vista previa de la próxima arquitectura Qwen4 para que los desarrolladores experimenten y evalúen.
- El modelo es una mezcla de expertos multimodal (MoE) con 176B de parámetros totales, incluyendo 51B de parámetros de incrustación N-gram.
- Activa 6B de parámetros por token mientras mantiene una ventana de contexto nativa de 262,144 tokens.
- La ventana de contexto es extensible a 1M de tokens usando YaRN.
Este lanzamiento permite a los desarrolladores evaluar las capacidades de la nueva arquitectura para tareas de codificación agéntica antes del lanzamiento oficial de Qwen4.