llama.cpp 项目发布了构建版本 b11362,引入了支持 F16 键值 (KV) 存储的新张量 API flash attention 内核。此更新适用于 macOS、Linux、Windows、Android 和 iOS 平台,并提供包括 CUDA、Vulkan 和 ROCm 在内的多种后端选项。
- 为特定维度添加了张量 FA 内核:DK=DV=512、DK=576/DV=512 和 DK=192/DV=128。
- 新内核支持 attention sinks、ALiBi 和 logit softcap 机制。
- 为 CPU、GPU (CUDA 12/13, Vulkan, ROCm 10.0) 和 NPU (Snapdragon Hexagon) 后端提供了预编译二进制文件。
此发布版本可在支持的硬件配置上实现更高效的注意力计算。