llama.cpp 项目发布了构建版本 b10781,其中包含对 Vulkan 快速注意力(FA)反量化路径的修复。此次更新解决了一个问题:当 `ne[3] == 1` 时,着色器错误地检查了 `nb[3]`,导致该路径仅在缓存满时才激活。

  • 当 `ne[3] == 1` 时跳过对 `nb[3]` 的检查,因为着色器对于单流不会读取它。
  • 解决了逻辑错误:缓存视图携带了全缓冲区步长,将旧检查简化为 `n_kv == kv_size`。
  • 提供了适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)以及 openEuler 的二进制文件。

此修复确保了 Vulkan FA 反量化路径在推理过程中能正确激活,而不再仅限于缓存满的状态。