llama.cpp 项目发布了构建版本 b11272,其中包括针对 Hexagon 后端的优化。主要更改集中在优化连接操作,以提高 Qualcomm Snapdragon 硬件上的性能。
- 通过在收集操作中直接写入目标缓冲区并使用特殊的 gather 同步指令,减少了 gather/transpose 热循环中的数据包数量。
- 使用 fastdiv 替换软件除法调用,以实现更快的计算。
- 优化了 DMA-HVX 流水线,并为 Hexagon 连接操作添加了转置辅助函数。
此更新为 macOS、Linux、Windows、Android 和 openEuler 提供了适用于各种 CPU、GPU 和 NPU 后端的二进制文件。