llama.cpp 项目发布了版本 b10702,其中包含针对 AMD gfx1201 架构上 Q2_0 量化点积路径的特定优化。此更新扩展了 HIP 实现以使用原生的 amdgcn 置换指令,从而改善此特定硬件配置的性能。

  • 使用原生 amdgcn 置换为 gfx1201 优化 `vec_dot_q2_0_q8_1`。
  • 扩展 HIP 的 Q2_0 置换优化并移除冗余的可用性保护。
  • 使用原生置换指令优化 HIP Q2_0 MMQ 解包。
  • 恢复 MMQ 图块索引处理,并在 CUDA 代码中标记 HIP 预处理器保护。

此版本为 macOS、Linux、Windows、Android 和 openEuler 提供二进制文件,支持 CPU、GPU(CUDA、ROCm、Vulkan、OpenCL)以及 OpenVINO 和 SYCL 等专用后端。