llama.cpp プロジェクトはバージョン b10997 をリリースし、RDNA3.5 アーキテクチャのサポートのために Mixture of Experts (MoE) ncols_opt タイルヒューリスティックに変更を加えました。

  • ggml/src/ggml-cuda/mmq.cu のコードが更新され、条件チェックに RDNA3.5 が含まれるようになりました。
  • AMD Radeon 8060S でのパフォーマンステストでは、LFM2.5-8B-A1B-UD-Q4_K_M で +16.198%、Qwen1.5-MoE-A2.7B-Q2_K で +6.189% の速度向上が示されました。
  • リリースでは、CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL バックエンド向けに macOS、Linux、Windows、Android、openEuler 用のバイナリが提供されています。