llama.cpp b11224 リリースは、KV キャッシュなどのより大きくストライド付きのテンソルのスライスを読み取る際に、Vulkan バックエンドで行列乗算演算が誤った計算結果を生じる問題を解決します。

  • 原地の src0 および src1 テンソルのバッチストライドは、ne00*ne01 ではなく nb[2] から正しく導出され、すべてのヘッド across で行アクセスが適切に行われます。
  • 原地の A および B 範囲は、ggml_nbytes または ggml_vk_subbuffer を使用してそのストライド付き拡張によってサイズ設定され、coopmat2 なしで NVIDIA ハードウェア上でゼロ出力データを読み込んだりハングしたりするのを防ぎます。
  • mul_mat_id および mul_mat パスが更新され、ストライド付きエキスパートビューと部分的なタイルを正しく処理し、NVFP4 演算でのハングを回避します。

この修正により、Vulkan バックエンドのストライド付きメモリレイアウトに依存するデコーダ自己注意機構の正確な推論結果が保証されます。