llama.cpp プロジェクトはビルド b10905 をリリースしました。これには gfx1201 アーキテクチャ上の CUDA/HIP 向けの Flash Attention の特定のチューニングが含まれます。このアップデートは AMD RDNA4 GPU のパフォーマンス最適化に焦点を当てています。

  • HIP: RDNA4 上で head size 256 の行列乗算加速 (mma) Flash Attention を有効にし、関連する構成をチューニングします。
  • HIP: AMD WMMA アーキテクチャ上で stream-k よりも全体タイルの Flash Attention グリッドを優先します。
  • 実行フローを改善するため stream_k ロジックを改訂しました。
  • ハードウェアターゲットをより適切にするため、カーネル選択ロジックを改訂しました。

このリリースでは、CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL、OpenCL を含むさまざまなバックエンドを通じて、macOS、Linux、Windows、Android、openEuler 用のバイナリが提供されます。