llama.cpp プロジェクトはビルド b11111 をリリースし、Xe-LPG Plus、Xe2、Xe3 アーキテクチャの split k パス向けに Vulkan ベースの flash attention 最適化カーネルを導入しました。
- Vulkan の split k パス用 Intel FA カーネル最適化を追加。
- split k FA カーネルパスの選択を処理するようにホストコードを更新。
- flash_attn_decode_phase_1 シェーダーで対称 coopMatMulAdd() を使用し、A770 Linux 演算子テストの失敗を修正。
- flash_attn_decode_phase_2.comp ファイル内の editorconfig の問題を解決。
このアップデートにより、Intel Arc GPU の最適化された推論機能が提供され、Linux システム上の特定のドライバー互換性問題が解消されます。