llama.cpp b10728 リリースは、Flash Attention K,V 共有メモリ fp16 タイルの CUDA XOR swizzle 実装を導入します。このアップデートは、DGX Spark ハードウェア上の Flash Attention における共有メモリの競合条件も解決します。
- CUDA 向けに fp16 タイル付きの XOR swizzle flash attention を実装。
- 32 ビット共有ポインターの代わりに 64 ビット汎用ポインターの使用を修正。
- swizzle のテストケースを追加し、同期を swizzled パスのみに制限。
- nbatch_2%32==0 の非 2 のべき乗形状での swizzling を許可。
- Flash Attention swizzle ldmatrix のロジックをヘルパー関数にリファクタリング。
このリリースでは、CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL バックエンド向けに、macOS、Linux、Windows、Android、openEuler 用のバイナリが提供されます。