llama.cpp 项目发布了版本 b11403,其中包括一项 CUDA 优化,用于在小批量大小下使用 MMVF 内核进行细粒度 f16 和 bf16 矩阵乘法。

  • 调整了内核选择逻辑以改善 NVIDIA GPU 上的性能。
  • 提供了适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL、Snapdragon)、Windows(CPU、OpenCL、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 openEuler 的二进制文件。
  • 除了标准二进制文件外,还包含了 iOS XCFramework 和 UI 构建版本。