A Zai apresentou o GLM-5.3-Flash, o primeiro modelo nativamente multimodal da série GLM-5. Ele possui uma arquitetura híbrida que combina atenção esparsa e linear para reduzir os custos de serviço de contextos longos enquanto mantém capacidades precisas.

  • O modelo tem 320B parâmetros totais com apenas 18B parâmetros ativos.
  • Supera o GLM-5.2 em benchmarks a um décimo do preço.
  • O desempenho se aproxima do Claude Opus 4.8 em benchmarks de codificação e agentes.
  • Usa Manifold-Constrained Hyper-Connections (mHC) para melhorar a eficiência de escalabilidade.
  • Treinado em um corpus multimodal pré-treinado de 30T tokens.

O modelo está disponível via Z.ai API Platform e suporta implantação com SGLang, vLLM, TokenSpeed, KTransformers e HLE.