llama.cpp 项目发布了版本 b10707,其中包括对键值 (KV) 缓存处理的一项性能优化。该更新修改了 `for_each_token_in` 函数,使其在已遍历特定单元内的所有序列后停止扫描,而不是迭代所有可能的最大序列数。

  • 此更改通过 `get_prev_tokens` 调用者针对 n-gram 路径。
  • 在配备 Qwen3.8-Flash-Next UD-Q4_K_XL 的 RTX PRO 6000 上,55k 上下文下的生成速度从每秒 56.3 个 token 提升至 74.3 个 token。
  • 在 132k 上下文中,生成速度从每秒 33.6 个 token 提升至 50.9 个 token。
  • 该优化随使用单元数量的增加而扩展,使得在更长上下文中的收益更加明显,同时保持提示词处理不变。

此次发布提供了适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、CUDA、Vulkan、OpenVINO、SYCL、ROCm)以及 openEuler 的二进制文件。