llama.cpp b10338 版本解决了模型保存器中的一个关键错误,该错误导致共享专家混合专家(MoE)模型在保存后无法加载。问题源于保存器错误地将 `n_ff_chexp` 值写入 `LLM_KV_EXPERT_SHARED_FEED_FORWARD_LENGTH` 键,从而破坏了正确的张量形状信息。

  • 修复措施确保第二次调用写入正确的 `LLM_KV_EXPERT_CHUNK_FEED_FORWARD_LENGTH` 键,而不是覆盖共享前馈长度。
  • 这解决了具有共享专家的架构的加载失败问题,包括 qwen2moe、qwen3-next、granite-moe、hunyuan-moe、ernie4.5、bailingmoe2 和 nemotron-h。
  • 该版本包含适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、CUDA 12/13、Vulkan、OpenCL、OpenVINO、SYCL、HIP)和 openEuler 的二进制文件。

此修复确保了具有共享专家的 MoE 模型的保存和加载往返成功,且没有张量形状不匹配的问题。