llama.cpp プロジェクトは、AMD Strix Halo ハードウェアを対象とした Vulkan バックエンドの特定の最適化を含むビルド b10714 をリリースしました。このアップデートは、バッチ推論中のパフォーマンスを向上させるために行列-ベクトル乗算の行数を調整します。

  • Vulkan: 4つ以上の列を持つ RDNA3 アーキテクチャの mat-vec 操作に対して静的な 4 行を設定し、この構成がデフォルトよりもベンチマークで高速であることを示しています。
  • Vulkan: Strix Halo マシンにおける mul_mat_vec_id に対して静的な 4 行設定を適用し、デフォルトと比較して様々なタイプやバッチサイズでより高速であることが証明されています。

これらの変更により、Strix Halo などの RDNA3 ベースの GPU で llama.cpp を実行するユーザーに実質的なパフォーマンス向上がもたらされます。