llama.cpp 项目发布了 b10947 版本,解决了 Nemotron-H 模型加载时的关键崩溃问题。该更新防止了当 NextN/MTP 尾部循环从包含非 MoE 层零值的逐层数组中推导专家 FFN 大小时出现的除零错误。

  • 通过报告格式错误的元数据而不是除以零来修复 expert_feed_forward_length 缺失时的 SIGFPE 崩溃。
  • 提供适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、CUDA 12/13、OpenCL、Vulkan、OpenVINO、SYCL、ROCm)和 openEuler 的二进制文件。

此更改防止应用程序在加载检查点时因信号错误而崩溃,确保具有混合 MoE 和密集层的模型稳定运行。