Zhipu AI ha lanzado GLM-5.3-Flash, el primer modelo nativamente multimodal de la serie GLM-5 y el primer lanzamiento de peso abierto de la arquitectura glm5_next. El modelo de 320B parámetros se entrena en un corpus multimodal de 30T tokens y presenta un mecanismo de atención híbrido disperso y lineal para reducir los costos de servicio de contexto largo.

  • Arquitectura: 45 capas que combinan atención lineal KDA con atención dispersa estilo DeepSeek, utilizando Hyper-Conexiones Restringidas por Variedad (mHC) para la eficiencia de escalado.
  • Capacidades multimodales: Un codificador ViT de 24 capas permite tokens de imagen y video en el vocabulario, soportando una longitud de contexto de hasta 1.048.576 tokens.
  • Pesos: Disponibles en formatos FP8 (e4m3) y BF16 en Hugging Face y ModelScope bajo licencia MIT.
  • Soporte de inferencia: Recetas oficiales proporcionadas para vLLM y SGLang, incluyendo configuraciones de decodificación especulativa.

El lanzamiento tiene como objetivo ofrecer una alternativa rentable que se acerca al rendimiento de Claude Opus 4.8 en benchmarks de codificación y agentes, mientras reduce significativamente los costos de inferencia.