llama.cpp 项目发布了构建版本 b10982,引入了通过 Vulkan 后端对稀疏 Flash Attention 的支持。此更新专门针对 DSV4 和 GLM 模型,使它们能够在兼容的 GPU 硬件上利用稀疏注意力机制。
- 在 Vulkan 实现中为 DSV4/GLM 添加稀疏 Flash Attention 支持。
- 包含调优后的实现逻辑并添加了测试。
- 修复了非确定性 atomicAdd 行为。
- 添加了 cm2 解码向量支持和用于解码向量的 f16vec4 绑定。
- 简化了逻辑并提高了变量命名的一致性。
该版本提供了适用于 macOS、Linux、Windows、Android 和 openEuler 的预编译二进制文件,涵盖 CPU、CUDA、ROCm、OpenVINO、SYCL 和 Vulkan 后端。