El proyecto llama.cpp ha lanzado la compilación b10174, introduciendo soporte de descodificación especulativa NextN/MTP para la arquitectura del modelo GLM_DSA (GLM-5.2).
- Añade GLM-5.2 NextN/MTP como objetivo --spec-type draft-mtp, habilitando la atención MLA densa y la configuración KV de contexto MTP.
- Actualiza el script de conversión para soportar la exportación --mtp/--no-mtp para GlmMoeDsaForCausalLM, permitiendo a los usuarios eliminar o mantener el bloque NextN durante la exportación.
- Proporciona binarios precompilados para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL) y plataformas openEuler.
Esta actualización permite velocidades de inferencia más rápidas para los modelos GLM-5.2 aprovechando las técnicas de descodificación especulativa dentro del marco llama.cpp.