llama.cpp 项目发布了版本 b10900,其中包含对 Vulkan 后端的技術更新。此版本添加了分配依赖项,专门用于在预填充阶段启用 topk_moe 融合优化。

  • 主要的代码更改是在 Vulkan 实现中添加分配依赖项,以支持预填充操作的 topk_moe 融合。
  • 提供适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、ROCm 10.0、OpenVINO、SYCL)、Windows(CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm 10.0)、Android 和 iOS 的二进制文件。
  • 此构建中禁用了 macOS Apple Silicon 的 KleidiAI 支持。

通过新启用的融合技术,此更新为 Vulkan 兼容硬件上的用户提供了优化的预填充性能。