llama.cpp プロジェクトはバージョン b11140 をリリースし、dsv4 prefill に sparse-fa を有効化する CUDA の最適化が含まれています。このアップデートは、コンパイル時のループ展開を可能にするためにカーネルをテンプレート化することで、flash attention マススク scanning プロセスのパフォーマンス問題を解決します。
- `flash_attn_mask_to_sparse_indices` のクエリループはコンパイル時に境界が設定され、49k 列のスパースデコード形状においてスキャン時間を 46 マイクロ秒から 17 マイクロ秒に削減しました。
- スパースマスクスキャンのアウトオブバウンズチェックはホストコードに移動され、49k コンテキストでのバッチスパース演算の実行時間が 586 マイクロ秒から 244 マイクロ秒に低下しました。
このリリースでは、CPU、GPU、NPU バックエンド向けに macOS、Linux、Windows、Android、openEuler のバイナリが提供されています。