llama.cpp プロジェクトはバージョン b11140 をリリースし、dsv4 prefill に sparse-fa を有効化する CUDA の最適化が含まれています。このアップデートは、コンパイル時のループ展開を可能にするためにカーネルをテンプレート化することで、flash attention マススク scanning プロセスのパフォーマンス問題を解決します。

  • `flash_attn_mask_to_sparse_indices` のクエリループはコンパイル時に境界が設定され、49k 列のスパースデコード形状においてスキャン時間を 46 マイクロ秒から 17 マイクロ秒に削減しました。
  • スパースマスクスキャンのアウトオブバウンズチェックはホストコードに移動され、49k コンテキストでのバッチスパース演算の実行時間が 586 マイクロ秒から 244 マイクロ秒に低下しました。

このリリースでは、CPU、GPU、NPU バックエンド向けに macOS、Linux、Windows、Android、openEuler のバイナリが提供されています。