A Zhipu AI lançou o GLM-5.3-Flash, o primeiro modelo nativamente multimodal da série GLM-5 e o primeiro lançamento de pesos abertos da arquitetura glm5_next. O modelo com 320B parâmetros é treinado em um corpus multimodal de 30T tokens e apresenta um mecanismo de atenção híbrido esparso e linear para reduzir os custos de serviço de contexto longo.

  • Arquitetura: 45 camadas combinando atenção linear KDA com atenção esparsa no estilo DeepSeek, utilizando Hyper-Conexões Restritas por Variedade (mHC) para eficiência de escalonamento.
  • Capacidades multimodais: Um codificador ViT de 24 camadas permite tokens de imagem e vídeo no vocabulário, suportando um comprimento de contexto de até 1.048.576 tokens.
  • Pesos: Disponíveis nos formatos FP8 (e4m3) e BF16 no Hugging Face e ModelScope sob uma licença MIT.
  • Suporte à inferência: Receitas oficiais fornecidas para vLLM e SGLang, incluindo configurações de decodificação especulativa.

O lançamento visa oferecer uma alternativa econômica que se aproxima do desempenho do Claude Opus 4.8 em benchmarks de codificação e agentes, ao mesmo tempo que reduz significativamente os custos de inferência.