llama.cpp 项目发布了构建版本 b10693,引入了对 Qualcomm Hexagon NPU 的支持。此更新启用运行时发现可用的 NPU 核心,并允许按需创建推理会话。

  • 为 Hexagon 设备添加了延迟会话分配和清理接口。
  • 实现了可用 NPU 核心的运行时发现。
  • 配置了初始化期间对不存在设备的早期拒绝。
  • 提供了适用于 macOS、Linux、Windows、Android 和 openEuler 的二进制文件,支持 CPU、Vulkan、ROCm、OpenVINO、SYCL 和 CUDA 后端。