llama.cpp プロジェクトはバージョン b11214 をリリースしました。これには HIP バックエンドへの重要な更新が含まれています。このリリースでは、dkq > 256 の場合、CDNA アーキテクチャ上で fattn-mma カーネルが有効化され、大きなバッチサイズ向けの性能向上を特に狙っています。

  • HIP バックエンドは CDNA ハードウェア上で dkq > 256 の fattn-mma カーネルをサポートするようになりました。
  • hip-quality-check の CI チェックが更新され、非常に大きな mfma mma カーネルのスパイルを無視するようになりました。
  • macOS (Apple Silicon および Intel)、Linux (CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL、Snapdragon)、Windows (CPU、CUDA、Vulkan、OpenVINO、SYCL、ROCm)、Android、openEuler 用のバイナリが提供されています。

この更新により、AMD CDNA GPU で llama.cpp を実行しているユーザーは、より大きなバッチサイズ向けの最適化されたアテンションカーネルを利用できるようになります。