llama.cpp プロジェクトはバージョン b10947 をリリースし、Nemotron-H モデルの重要なロード時クラッシュに対処しました。この更新は、NextN/MTP 尾部ループが非 MoE レイヤーに対してゼロ値を持つレイヤーごとの配列からエキスパート FFN サイズを導出する際に発生するゼロ除算エラーを防ぎます。

  • expert_feed_forward_length が欠落している場合、ゼロ除算の代わりに不正なメタデータを報告することで SIGFPE クラッシュを修正します。
  • macOS (Apple Silicon および Intel)、iOS、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows (CPU、CUDA 12/13、OpenCL、Vulkan、OpenVINO、SYCL、ROCm)、openEuler 用のバイナリを提供します。

この変更により、チェックポイント読み込み中にシグナルエラーでアプリケーションが終了するのを防ぎ、MoE レイヤーと密なレイヤーが混在するモデルの安定した動作を保証します。