llama.cpp 项目发布了版本 b10830,引入了一个用于模型转换的新命令行选项。此更新添加了 `--fuse-qkv` 标志,允许用户在从 Hugging Face 格式转换为 GGUF 期间将 Query、Key 和 Value 矩阵融合为单个 QKV 结构。

  • 该版本包括适用于 macOS(Apple Silicon 和 Intel)、Linux(Ubuntu 的 CPU、Vulkan、ROCm、OpenVINO 和 SYCL 后端)、Android、Windows(CPU、CUDA 12/13、Vulkan、OpenCL、ROCm、OpenVINO 和 SYCL)以及 openEuler 的二进制文件。
  • iOS 支持通过 XCFramework 提供,而 macOS Apple Silicon 上的 KleidiAI 支持目前已被禁用。

此更新为受益于融合注意力机制的模型提供了更高效的转换路径。