llama.cpp プロジェクトはバージョン b10899 をリリースし、Vulkan バックエンドに特定の性能向上を導入しました。このアップデートは、Qwen モデルファミリーの行列演算の最適化と、小規模な M における全体的なパフォーマンスの強化に焦点を当てています。

  • Vulkan 内で A/B 行列を交換することで m=1 の mul_mat を最適化します。
  • 小規模な M 次元のパフォーマンスを向上させます。
  • 小規模な M 値に対して split_k サポートを有効にします。
  • coopmat2 の小サイズと中サイズのタイル選択を、N のみに依存するのではなく M に依存するように調整します。

これらの変更は、特に指定された行列最適化の恩恵を受ける Qwen などのモデルにおいて、Vulkan 互換ハードウェアでの推論効率を向上させることを目的としています。