llama.cpp 项目发布了构建版本 b11043,其中包含对 HMX flash-attention 实现的更改。此更新支持非 64 倍数的头维度,特别允许如 SigLIP 的 head_dim=72 配置。
- HMX flash-attention 内核现在以 DK/DV 向上取整到 64 的方式运行,尾部通道填充为零。
- 预编译二进制文件适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL)、Windows(CPU、OpenCL、CUDA、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 openEuler。
此更改允许用户在支持的硬件上运行具有非标准头维度的模型,而不会出现兼容性问题。