llama.cpp 项目发布了版本 b11062,其中包含一个拉取请求,为 Qwen4 模型启用了稀疏 Flash Attention (FA) 支持。

此更新是更广泛的 b11062 发布的一部分,该发布提供了适用于 macOS、Linux、Windows、Android 和 openEuler 的二进制文件,支持 CPU、GPU(CUDA、ROCm、Vulkan)以及 AI 加速器后端。

发行说明中提到的特定更改为 Qwen4 添加了稀疏 FA 功能,以提高效率。