llama.cpp b11413 リリースは、量子化されたKeyおよびValueテンソルをサポートする新しいVulkan実装のスパースフラッシュアテンションを導入しました。この更新は、大きなコンテキストウィンドウを持つデコーディングタスクにはコストが高すぎた以前の圧縮方法のパフォーマンス問題を解決します。

  • 新しいアプローチは、行を連続したセグメントに分割し、サブグループまたはスレッドによって処理されます。昇順のインデックスリストを維持するために、協調ロード上の投票カウントを使用します。
  • macOS(Apple SiliconおよびIntel)、Linux(CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL、Snapdragon)、Windows(CPU、Vulkan、CUDA、OpenVINO、SYCL、ROCm)、Android、iOS用のビルド済みバイナリが利用可能です。
  • リリースにはllama.cpp UIとセキュリティ検証のためのアテストも含まれています。