llama.cpp プロジェクトはバージョン b10635 をリリースし、CUDA サポートに関する特定の変更が含まれています。主な変更点は、計算能力 6.0 (sm_60) の GPU 上で Mixture of Experts (MoE) アーキテクチャ向けの混合精度行列乗算 (mmq) のブロックを解除することです。

  • CUDA: sm_60 上の MoE 向け mmq をアンブロック。
  • CUDA: dp4a およびそれ以前のアーキテクチャ向けに mmq-config-pascal を複製。
  • CUDA: Q2_K、Q4_K、Q5_K、および Q6_K の量子化フォーマットに対して、dp4a 非搭載の Pascal GPU でのoccupancyを削減。

このリリースでは、macOS (Apple Silicon および Intel)、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows (CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android、および openEuler 用のバイナリが提供されています。