A Z.ai lançou o GLM-5.3-Flash, o primeiro modelo nativamente multimodal da série GLM-5, com uma arquitetura de mistura de especialistas (mixture-of-experts) contendo 320 bilhões de parâmetros totais e 18 bilhões ativos por token. O modelo suporta entradas de imagem e vídeo em uma janela de contexto de 1.048.576 tokens e está disponível sob a licença MIT no Hugging Face.

  • Ele emprega atenção híbrida, combinando camadas de atenção linear KDA com camadas MLA esparsas NoPE, roteando tokens por meio de 8 dos 288 especialistas.
  • Um mecanismo IndexPool reduz o cálculo de atenção em aproximadamente 3x e diminui o cache KV em 4,4x em comparação ao GLM-5.3.
  • Os benchmarks mostram pontuações de 84,3 no Terminal-Bench 2.1 e 63,4 no DeepSWE v1.1, posicionando-o próximo ao Claude Opus 4.8.
  • O preço da API é definido em US$ 0,15/M para tokens de entrada e US$ 0,50/M para tokens de saída, com auto-hospedagem exigindo ~306 GiB de pesos FP8.

O modelo visa fornecer uma solução de codificação econômica, superando o GLM-5.2 nos benchmarks por cerca de um décimo do preço, enquanto mantém alto desempenho em tarefas internas de codificação.