llama.cpp 项目发布了版本 b10643,引入了对多 NPU 设备(IQ9、IQ10)的支持以及针对 Hexagon 架构的完全异步后端。

  • Hexagon 后端现在默认使用非主机缓冲区并实现完全异步性。
  • 增加了对 Snapdragon Android 平台 34 的支持。
  • Q8_0 量化获得了对就地反量化器、DMA 管道和行操作的支持。
  • ALLREDUCE 操作通过融合内核和改进的 DMA 效率进行了优化。
  • 同步令牌和栅栏机制得到增强,以跨异步分割同步 NPU 设备。

这些更改通过在多 NPU Snapdragon 硬件上允许并发设备执行和更快的张量副本,从而实现高效的推理。