llama.cpp b11095 版本引入了针对 HMX 优化的 GATED_DELTA_NET (GDN) 实现,以及针对 Hexagon 和 Flash Attention 内核的各种优化。

  • GDN 支持包括流水线处理、HVX 线程化和向量化操作,以提升在 Qualcomm 芯片上的性能。
  • Flash Attention 更新通过寄存器内累加和 DMA 管道改进,在令牌生成期间将 DDR 读取量减少 20-30%。
  • 该版本为 macOS、Linux、Windows、Android 和 openEuler 提供了适用于 CPU、CUDA、ROCm、Vulkan 和 OpenVINO 后端的二进制文件。

此更新在保持与现有部署环境广泛兼容性的同时,提高了特定硬件架构上的推理效率。