A Z.ai lançou o GLM-5.3-Flash, um modelo MoE multimodal de 320B parâmetros com 18B parâmetros ativos, enquanto a equipe do Qwen da Alibaba lançou o Qwen3.8-Flash-Next, um modelo de 125B com 6B parâmetros ativos. Apesar do desenvolvimento independente, ambas as equipes adotaram configurações arquitetônicas quase idênticas.

  • Ambos os modelos usam uma combinação híbrida de camadas de atenção linear e completa na proporção de 3:1 para equilibrar eficiência e precisão.
  • O contexto é comprimido por um fator de 4 por meio de um indexador aprendido que limita o orçamento de atenção esparsa em 2048 tokens.
  • O único fluxo residual é substituído por quatro ramificações paralelas com gating para melhorar o controle de fluxo e reduzir a sobrecarga de memória.
  • O treinamento utiliza o otimizador Muon com matrizes de projeção fundidas divididas em transformações independentes antes da ortogonalização.
  • As equipes discordam sobre o codificador posicional: o GLM descarta o RoPE para usar NoPE, enquanto o Qwen manteve o RoPE após as variantes NoPE falharem em impedir a geração pós-treinamento.

Essa convergência sugere uma direção compartilhada da indústria para modelagem de contexto longo eficiente, embora a MiniMax permaneça como dissidente ao rejeitar a atenção linear devido a déficits de raciocínio.