llama.cpp 项目发布了构建版本 b11232,其中包括对 ggml-cpu 后端的更新。此次发布重点在于为 x86 架构上的非向量倍数头维度启用分块 flash attention。

  • 在 x86 上为非向量倍数头维度启用了分块 flash attention。
  • 在 simd_gemm_ukernel_tail 中添加了针对掩码加载和存储的 AVX2 支持。
  • 修复了填充 KV 块的 FA softcap 处理。

此更新为 CPU、GPU 和 NPU 后端提供了适用于 macOS、Linux、Windows、Android 和 openEuler 的二进制文件。