llama.cpp 项目发布了构建版本 b11026,其中引入了在设置 TENSOR_SKIP 标志时跳过 gate_up_exps 的更改。此修改专门针对 MTP 张量已融合但未加载的 Qwen35MoE 模型。

该版本为 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL)、Android、Windows(CPU、OpenCL、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm 10.0)和 openEuler 提供了二进制文件和框架。

此更新通过正确处理已融合但未加载的 MTP 张量,确保与特定 Qwen35MoE 配置的兼容性。