llama.cpp 项目发布了版本 b10201,其中包括对 ggml-webgpu 后端的重大改进。此更新增强了在处理长上下文生成期间的量化键值缓存时的 flash attention 性能。

  • 改进了 ggml-webgpu 中量化 KV 缓存的 flash attention 向量处理。
  • 修复了与值类型检查相关的错误并更新了注释。
  • 解决了由 rebase 引起的构建错误。
  • 提供了适用于 macOS(Apple Silicon、Intel)、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、CUDA 12/13、Vulkan、OpenCL、HIP、OpenVINO、SYCL)和 openEuler 的二进制文件。

此版本允许用户在广泛的硬件平台上运行 llama.cpp,同时从针对更长序列优化的注意力机制中受益。