llama.cpp 项目发布了 b11007 版本,引入了对 Multi-Token Prediction (MTP) 草稿中 CUDA graphs 的支持。此更新通过利用 CUDA graph 执行来提高草稿过程的效率。

  • 为 MTP 草稿启用 CUDA graph 以提高使用效率。
  • 提供 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、OpenCL、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)和 openEuler 的二进制文件。
  • 为所有支持的平台包含 UI 二进制文件。

此版本允许用户通过新的 MTP 草稿实现在兼容的 NVIDIA GPU 上获得优化的推理性能。