El proyecto llama.cpp ha añadido soporte inicial para la arquitectura del modelo GLM-5.3-Flash (GLM5-Next), incluyendo la migración a memoria de índice híbrido y capacidades tempranas de Multi-Token Prediction (MTP).
- Se añadió soporte inicial para MTP, aunque se eliminó para la solicitud de extracción inicial para permitir una revisión enfocada.
- El diseño de k-pool ahora se mantiene entre ubatches para evitar la obsolescencia después de las ediciones de secuencia y los desmontajes compartidos.
- Los puntos de control de retroceso recurrente se escriben correctamente para el estado conv y el estado delta net.
- Se corrigió un error en el stride del stream build_attn_mha para consultas no contiguas, asegurando un prellenado multi-stream correcto para GLM5-Next.
- Los filtros de protección de cuantización se limpiaron para eliminar entradas duplicadas.
Estos cambios aseguran una inferencia estable y una gestión correcta del estado para los modelos GLM5-Next en varios backends de hardware, incluyendo CUDA, ROCm y CPU.