llama.cpp 项目发布了构建版本 b10165,恢复了 Flash Attention (FA) Vulkan 后端的 iq4_nl 量化支持。此更改通过重新启用该功能解决了问题 #23681,此前关于共享内存使用的担忧被认为可以忽略不计。
- 将 iq4_nl 支持重新添加回 Vulkan FA 实现。
- 为 non-coopmat2 配置添加 q1_0 支持。
- 修复了关于移除 q1_0 FA 支持的 GitHub 问题 #23681。
该版本提供了适用于 macOS、Linux、Windows 和 Android 的二进制文件,涵盖 CPU、CUDA、ROCm、OpenVINO、SYCL 和 Vulkan 后端。