llama.cpp 项目发布了版本 b11309,其中包含针对 Hexagon 后端的关键优化。此更新为 ALLREDUCE 操作添加了对安全 scatter 模式的支持,旨在提高 Qualcomm Snapdragon 设备上的性能和稳定性。

  • 通过添加对安全 scatter 模式的支持来优化 Hexagon ALLREDUCE。
  • 重写 hex-allreduce 实现以消除寄存器溢出。
  • 减少 hex-allreduce 代码中的冗余注释。
  • 为 macOS(Apple Silicon 和 Intel)、Linux、Windows、Android 和 openEuler 提供 CPU、GPU 和 NPU 后端的二进制文件。

此版本在 Hexagon NPU 的移动硬件上实现了更高效的分布式推理,同时保持了与主要桌面和移动操作系统的广泛兼容性。