llama.cpp 项目发布了构建版本 b10758,引入了针对 Hexagon DSP 的 MUL_MAT 和 MUL_MAT_ID 融合功能。此次更新还包括多项修复,以改善 Qualcomm 硬件上的稳定性和性能。

  • 将落入 HMX 的 QKV 和 FFN 矩阵乘法进行融合。
  • 移除了硬编码的 ne[1] < 32K 限制。
  • 修正开销大小以防止大维度时超出 vtcm 预算。
  • 在可能的情况下将 MUL_MAT_ID 融合为 MUL_MAT_ID_NX 变体。
  • 更新 opbatch 和 opqueue 的大小以减少跟踪缓冲区分配的开销。
  • 添加虚拟地址空间去碎片化以避免因碎片导致的中止。

这些更改优化了基于 Hexagon 设备的内存使用和执行效率。