Z.ai ha lanzado GLM-5.3-Flash, el primer modelo nativamente multimodal de la serie GLM-5, que presenta una arquitectura de mezcla de expertos con 320 mil millones de parámetros totales y 18 mil millones activos por token. El modelo admite entradas de imagen y video dentro de una ventana de contexto de 1,048,576 tokens y está disponible bajo una licencia MIT en Hugging Face.
- Emplea atención híbrida que combina capas de atención lineal KDA con capas MLA dispersas NoPE, enrutando los tokens a través de 8 de 288 expertos.
- Un mecanismo IndexPool reduce el cálculo de atención aproximadamente 3x y disminuye la caché KV 4.4x en comparación con GLM-5.3.
- Las evaluaciones muestran puntuaciones de 84.3 en Terminal-Bench 2.1 y 63.4 en DeepSWE v1.1, situándolo cerca de Claude Opus 4.8.
- Los precios de la API se fijan en $0.15/M para tokens de entrada y $0.50/M para tokens de salida, requiriendo el autoalojamiento ~306 GiB de pesos FP8.
El modelo tiene como objetivo proporcionar una solución de codificación rentable, superando reportedly a GLM-5.2 en las evaluaciones a aproximadamente una décima parte del precio mientras mantiene un alto rendimiento en tareas internas de codificación.