llama.cpp b10338リリースは、共有エクスパートMixture-of-Experts (MoE) モデルが保存後に読み込みに失敗する原因となっていたモデルセーバーの重大なバグを解決しました。この問題は、セーバーが `n_ff_chexp` 値を `LLM_KV_EXPERT_SHARED_FEED_FORWARD_LENGTH` キーに誤って書き込み、正しいテンソル形状情報を上書きしていたことに起因していました。

  • この修正により、2回目の呼び出しで共有フィードフォワード長を上書きするのではなく、正しい `LLM_KV_EXPERT_CHUNK_FEED_FORWARD_LENGTH` キーが書き込まれるようになります。
  • これにより、qwen2moe、qwen3-next、granite-moe、hunyuan-moe、ernie4.5、bailingmoe2、nemotron-hなど、共有エクスパートを持つアーキテクチャの読み込み失敗が解消されました。
  • このリリースには、macOS (Apple Silicon および Intel)、iOS、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows (CPU、CUDA 12/13、Vulkan、OpenCL、OpenVINO、SYCL、HIP)、openEuler のバイナリが含まれています。

この修正により、共有エクスパートを持つMoEモデルの保存・読み込みラウンドトリップが、テンソル形状の不整合なしで成功することが保証されます。