llama.cpp プロジェクトはビルド b11362 をリリースし、F16 キーバリュー (KV) ストレージをサポートする新しいテンソル API フラッシュアテンションカーネルを導入しました。このアップデートは、CUDA、Vulkan、ROCm を含むさまざまなバックエンドオプションとともに、macOS、Linux、Windows、Android、iOS のプラットフォームで利用可能です。
- 特定の次元に対するテンソル FA カーネルを追加: DK=DV=512、DK=576/DV=512、および DK=192/DV=128。
- 新しいカーネルは attention sinks、ALiBi、logit softcap メカニズムをサポートします。
- CPU、GPU (CUDA 12/13, Vulkan, ROCm 10.0)、および NPU (Snapdragon Hexagon) バックエンド用にビルド済みバイナリが提供されています。
このリリースにより、対応するハードウェア構成でより効率的なアテンション計算が可能になります。