Z.ai lanzó GLM-5.3-Flash, un modelo MoE multimodal de 320B parámetros con 18B parámetros activos, mientras que el equipo de Qwen de Alibaba lanzó Qwen3.8-Flash-Next, un modelo de 125B con 6B parámetros activos. A pesar del desarrollo independiente, ambos equipos adoptaron configuraciones arquitecturales casi idénticas.

  • Ambos modelos utilizan una mezcla híbrida 3:1 de capas de atención lineal y completa para equilibrar la eficiencia y la precisión.
  • El contexto se comprime por un factor de 4 mediante un indexador aprendido que limita el presupuesto de atención dispersa a 2048 tokens.
  • El único flujo residual se reemplaza por cuatro ramas paralelas con compuerta para mejorar el control del flujo y reducir la sobrecarga de memoria.
  • El entrenamiento utiliza el optimizador Muon con matrices de proyección fusionadas divididas en transformaciones independientes antes de la ortogonalización.
  • Los equipos discrepan sobre el codificado posicional: GLM elimina RoPE por NoPE, mientras que Qwen conservó RoPE después de que las variantes NoPE fallaran al detener la generación post-entrenamiento.

Esta convergencia sugiere una dirección compartida en la industria para el modelado eficiente de contexto largo, aunque MiniMax permanece como disidente al rechazar la atención lineal debido a déficits de razonamiento.