llama.cpp 项目发布了构建版本 b11207,引入了对 Hexagon 后端上 Q4_0 和 Q8_0 GET_ROWS 分块操作的支持。此更新还包括对宏、寄存器溢出和 DMA 管道的修复,以及内核选择逻辑的改进和重新启用的向量化。
- 使用分块 HVX 反量化为 Hexagon 添加了 Q4_0 和 Q8_0 GET_ROWS 的分块支持。
- 在清理不支持的操作检查时,修复了 hex-get-rows 中的宏和寄存器溢出问题。
- 改进了 DMA 管道并简化了内核选择逻辑。
- 在采样器更新期间发现回归后,重新启用了向量化器。
该版本为 macOS、Linux、Windows、Android 和 openEuler 提供了二进制文件,支持包括 CPU、GPU、NPU、CUDA、ROCm、Vulkan、OpenVINO 和 SYCL 在内的各种硬件后端。