llama.cpp 项目发布了构建版本 b10714,其中包括针对 AMD Strix Halo 硬件的 Vulkan 后端的特定优化。该更新调整了矩阵-向量乘法行数,以改进批量推理期间的性能。
- Vulkan:在具有超过四列的 RDNA3 架构上为 mat-vec 操作设置静态 4 行,因为此配置在基准测试中比默认值更快。
- Vulkan:对 Strix Halo 机器上的 mul_mat_vec_id 应用静态 4 行设置,与默认值相比,在各种类型和批次大小下证明速度更快。
这些更改为在基于 RDNA3 的 GPU(如 Strix Halo)上运行 llama.cpp 的用户提供了可感知的性能提升。