llama.cpp 项目发布了构建版本 b10796,其中包含对模型加载器的更改,以支持每层专家数量不同的模型。

  • 添加了 `n_expert_used_max` 函数以在模型加载期间处理专家层检查。
  • 更新 `llama_model_base::load_hparams` 以使用 `hparams.n_expert_used_max` 而不是断言失败。
  • 解决了加载具有特定专家配置(如 NVIDIA Nemotron-3-Puzzle-75B-A9B)的模型时的错误。

此更新允许 llama.cpp 正确加载和处理每层使用的专家数量不同的模型,防止初始化期间的断言失败。