llama.cpp 项目发布了版本 b10635,其中包括对 CUDA 支持的具体更新。主要更改是解锁了在计算能力 6.0 (sm_60) GPU 上用于混合专家 (MoE) 架构的混合精度矩阵乘法 (mmq)。
- CUDA:解锁了 sm_60 上 MoE 的 mmq。
- CUDA:为 dp4a 和更旧的架构复制了 mmq-config-pascal。
- CUDA:减少了非 dp4a Pascal GPU 在 Q2_K、Q4_K、Q5_K 和 Q6_K 量化格式下的占用率。
此版本提供了适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows(CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 openEuler 的二进制文件。