llama.cpp 项目发布了构建版本 b10238,其中引入了对 Qwen3-Next 模型系列的 Multi-Token Prediction (MTP) 支持。此更新包括处理 MTP 层的具体实现更改,以及修复代码库中与 Python 类型检查相关的问题。
- 在 src/models/qwen3next.cpp 中为 Qwen3-Next 模型添加了 MTP 支持。
- 直接从 MTP 层计算 num_mtp,并在 _QwenMtpMixin 中定义了 opt_num_mtp_layers。
- 解决了 Python 类型检查问题并更新了 gguf-py/gguf/constants.py。
- 提供了适用于 macOS (Apple Silicon/Intel)、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows (CPU、CUDA 12/13、Vulkan、OpenCL、OpenVINO、SYCL、HIP) 和 openEuler 的二进制文件。
此发布使用户能够在广泛的硬件架构和操作系统上运行具有 MTP 功能的 Qwen3-Next 模型。