A ZhiPu apresenta o GLM-5.3-Flash, o primeiro modelo nativamente multimodal da série GLM-5, que possui uma arquitetura híbrida combinando atenção esparsa e linear para reduzir os custos de serviço de contexto longo enquanto preserva a precisão.

O modelo utiliza 320B parâmetros totais com apenas 18B parâmetros ativos, alcançando desempenho que supera o GLM-5.2 em benchmarks e se aproxima do Claude Opus 4.8 em tarefas de codificação por um décimo do preço. As inovações técnicas-chave incluem Manifold-Constrained Hyper-Connections (mHC) para melhorar a eficiência de escalabilidade e um modelo base recém-treinado otimizado em torno de capacidade e eficiência.

O GLM-5.3-Flash está disponível através da Plataforma API da Z.ai e suporta implantação por meio de frameworks incluindo SGLang, vLLM, TokenSpeed, KTransformers e HLE.