llama.cpp 项目发布了版本 b10669,其中包括通过就地绑定 f16 KV 缓存来优化 oneDNN SDPA 路径的性能改进。
- 该更改减少了预填充块期间的内存流量;例如,在 Qwen3.8 27B 上,当活跃 KV 长度为 34816 时,通过避免分阶段复制,将每个 ubatch 的流量从 4.56 GB 降低至更低。
- 二进制文件适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、CUDA、OpenCL、Vulkan、OpenVINO、SYCL、ROCm)以及 openEuler。
此更新在保持广泛平台兼容性的同时,为用户提供支持硬件上的优化推理性能。