llama.cpp 项目发布了版本 b10247,解决了在多后端设置下加载大型混合专家(MoE)模型时的稳定性问题。此次更新将后端调度器中的固定大小数组替换为动态分配的缓冲区,以处理超过 30 个输入张量的图分割。

  • 使用动态分配替换 GGML_SCHED_MAX_SPLIT_INPUTS 用于分割图的输入。
  • 修复加载宽 MoE 模型(如 Gemma 4、Qwen MoE、Mixtral 和 DeepSeek)时的崩溃问题。
  • 更新 graph_size 计算,以使用实际输入数量而非固定常量。
  • 提供适用于 macOS(Apple Silicon/Intel)、Linux(CPU/Vulkan/ROCm/OpenVINO/SYCL)、Windows(CPU/CUDA/Vulkan/OpenVINO/SYCL/HIP)、Android 和 iOS 的二进制文件。

此更改允许用户在拥有多个后端设备的系统上运行复杂的 MoE 架构,而不会遇到与调度器相关的崩溃。