llama.cpp プロジェクトはビルド b10905 をリリースしました。これには gfx1201 アーキテクチャ上の CUDA/HIP 向けの Flash Attention の特定のチューニングが含まれます。このアップデートは AMD RDNA4 GPU のパフォーマンス最適化に焦点を当てています。
- HIP: RDNA4 上で head size 256 の行列乗算加速 (mma) Flash Attention を有効にし、関連する構成をチューニングします。
- HIP: AMD WMMA アーキテクチャ上で stream-k よりも全体タイルの Flash Attention グリッドを優先します。
- 実行フローを改善するため stream_k ロジックを改訂しました。
- ハードウェアターゲットをより適切にするため、カーネル選択ロジックを改訂しました。
このリリースでは、CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL、OpenCL を含むさまざまなバックエンドを通じて、macOS、Linux、Windows、Android、openEuler 用のバイナリが提供されます。