llama.cpp 项目发布了构建版本 b11266,其中包含一项 Vulkan 优化:当数据满足 2 字节对齐时,每次加载两个元素的 F32 A 矩阵。此更改解决了 Intel 硬件上逐个加载浮点数效率低下的性能问题,并修正了原始补丁中缺失的 `a_offset` 对齐验证。
- 该修改利用了 `mul_mat_vec` 中现有的 2 字节对齐加载逻辑,以提升 Intel BMG 架构上的吞吐量。
- 在 Intel B60 上的基准测试结果显示,针对特定矩阵乘法形状实现了显著加速,其中一个测试用例的性能从 153.08 GFLOPS 提升至 221.66 GFLOPS,另一个则高达 1.63 TFLOPS。
- 该版本提供了适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL、Snapdragon)、Android、Windows 和 openEuler 的二进制文件。
此更新通过优化浮点矩阵操作的内存访问模式,提升了使用 Vulkan 后端的 Intel GPU 上的推理性能。