llama.cpp 项目发布了构建版本 b10517,在 flash attention (FA) 反量化路径中引入了几项针对 Vulkan 的改进。关键更改包括:在 coopmat1 中对 q8_0 KV 进行一次反量化、在 coopmat2 上跳过 FA 反量化路径,以及将 Intel Xe1 排除在 FA 反量化路径之外。

  • 当 FA scratch 超过 maxStorageBufferRange 时,Vulkan 现在会回退而不是中止。
  • 该版本要求在 FA 反量化路径中使用特定的 KV-cache 布局。
  • 收紧了 FA 路径的置换检查,并修正了 prealloc_x_need_sync 的时间。
  • 添加了针对连续分配 K/V FA 场景的测试。

此更新通过解决内存管理和硬件兼容性中的边缘情况,增强了 Vulkan 用户的稳定性和性能。