llama.cpp 项目发布了构建版本 b10905,其中包括对 gfx1201 架构上 CUDA/HIP 的 Flash Attention 进行特定调整。此更新专注于优化 AMD RDNA4 GPU 的性能。

  • HIP:为 RDNA4 上的 head size 256 启用矩阵乘法加速 (mma) Flash Attention 并调整相关配置。
  • HIP:在 AMD WMMA 架构上优先使用整块 Flash Attention 网格而非 stream-k。
  • 修订了 stream_k 逻辑以改善执行流程。
  • 修订了内核选择逻辑以实现更好的硬件目标定位。

该版本提供了适用于 macOS、Linux、Windows、Android 和 openEuler 的二进制文件,支持包括 CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL 和 OpenCL 在内的各种后端。