llama.cpp 项目发布了版本 b10206,引入了对注意力机制中键值缓存处理方式的具体更改。此次更新确保 DeepSeek V4 模型的 K 和 V 缓存类型保持一致。

  • 对 DeepSeek V4 架构强制执行相同的 K 和 V 缓存类型。
  • 当 V 缓存被量化时启用 Flash Attention (FA)。
  • 将相同的 K 和 V 缓存类型强制执行应用于其他 MLA 模型。

此版本为 macOS、Linux、Windows、Android 和 openEuler 提供了二进制文件,支持包括 CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL 和 OpenCL 在内的各种硬件后端。