llama.cpp b10728 リリースは、Flash Attention K,V 共有メモリ fp16 タイルの CUDA XOR swizzle 実装を導入します。このアップデートは、DGX Spark ハードウェア上の Flash Attention における共有メモリの競合条件も解決します。

  • CUDA 向けに fp16 タイル付きの XOR swizzle flash attention を実装。
  • 32 ビット共有ポインターの代わりに 64 ビット汎用ポインターの使用を修正。
  • swizzle のテストケースを追加し、同期を swizzled パスのみに制限。
  • nbatch_2%32==0 の非 2 のべき乗形状での swizzling を許可。
  • Flash Attention swizzle ldmatrix のロジックをヘルパー関数にリファクタリング。

このリリースでは、CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL バックエンド向けに、macOS、Linux、Windows、Android、openEuler 用のバイナリが提供されます。