llama.cpp 项目发布了构建版本 b11064,该版本修改了 metal 后端以支持 dsv4_hc_pre 内核中的任意头数 (hc)。此前,这些内核硬编码了 hc = 4,导致使用其他头数的操作回退到 CPU 执行。

  • 此更改将 n_hc 作为函数常量传递,并在两个预内核中通过直接加载对其进行循环。
  • 为 hc 值 1、2、3、5、8 和 65 添加了 test-backend-ops 用例,涵盖了门控和非门控场景。
  • 此更新通过在跨层残差堆栈中支持动态分块检查点计数,使 Kimi-K3 等模型能够在 GPU 上高效运行。

该版本包含适用于 macOS、Linux、Windows、Android 和 openEuler 的二进制文件,涵盖包括 CPU、CUDA、ROCm、Vulkan、OpenVINO 和 SYCL 在内的各种硬件后端。