llama.cpp 项目发布了版本 b11214,其中包含对 HIP 后端的重大更新。此版本在 dkq > 256 时在 CDNA 架构上启用了 fattn-mma 内核,专门针对大批量进行性能优化。

  • HIP 后端现在支持在 CDNA 硬件上 dkq > 256 时的 fattn-mma 内核。
  • hip-quality-check 的 CI 检查已更新,以忽略非常大的 mfma mma 内核的溢出。
  • 提供 macOS (Apple Silicon 和 Intel)、Linux (CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL、Snapdragon)、Windows (CPU、CUDA、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 openEuler 的二进制文件。

此更新允许在 AMD CDNA GPU 上运行 llama.cpp 的用户利用针对更大批量的优化注意力内核。