llama.cpp 项目发布了版本 b10907,其中包括对多令牌预测 (MTP) 上下文键值缓存分配的修复。此更新解决了影响 deepseek2、glm4moe 和 cohere2moe 架构的问题。

  • 修复了 deepseek2、glm4moe 和 cohere2moe 模型的 MTP 上下文 kv 缓存分配。
  • 添加了反向架构门控和全面的架构测试,用于 MTP 层过滤。
  • 简化了 NextN 过滤器注释并删除了 test-llama-archs 的更改。

该版本提供了适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、CUDA、OpenCL、Vulkan、OpenVINO、SYCL、ROCm)和 openEuler 的二进制文件。