llama.cpp 项目发布了构建版本 b10174,为 GLM_DSA (GLM-5.2) 模型架构引入了 NextN/MTP 推测解码支持。
- 将 GLM-5.2 NextN/MTP 添加为 --spec-type draft-mtp 目标,启用密集 MLA 注意力和 MTP 上下文 KV 设置。
- 更新转换脚本以支持 GlmMoeDsaForCausalLM 的 --mtp/--no-mtp 导出,允许用户在导出时选择丢弃或保留 NextN 块。
- 提供适用于 macOS (Apple Silicon 和 Intel)、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows (CPU、CUDA 12/13、Vulkan、OpenCL、ROCm、SYCL) 以及 openEuler 平台的预构建二进制文件。
此更新通过在 llama.cpp 框架内利用推测解码技术,实现了 GLM-5.2 模型更快的推理速度。