O projeto llama.cpp lançou a compilação b10174, introduzindo suporte à decodificação especulativa NextN/MTP para a arquitetura do modelo GLM_DSA (GLM-5.2).
- Adiciona GLM-5.2 NextN/MTP como alvo --spec-type draft-mtp, habilitando atenção MLA densa e configuração de KV de contexto MTP.
- Atualiza o script de conversão para suportar a exportação --mtp/--no-mtp para GlmMoeDsaForCausalLM, permitindo que os usuários removam ou mantenham o bloco NextN durante a exportação.
- Fornece binários pré-compilados para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL) e plataformas openEuler.
Esta atualização permite velocidades de inferência mais rápidas para os modelos GLM-5.2 ao aproveitar técnicas de decodificação especulativa dentro do framework llama.cpp.