llama.cpp 项目已发布构建版本 b11118,其中包含一项新的 hex-dma 功能,引入了更适合 Hexagon Vector eXtended (HVX) FA 掩码处理的直接映射 DMA 缓存。

此次发布提供了跨多个平台和硬件后端的二进制文件与框架:

  • macOS Apple Silicon (arm64)、macOS Intel (x64) 以及 iOS XCFramework
  • Linux Ubuntu x64、arm64、s390x 以及各种 GPU/CPU 后端,包括 CUDA 12/13、ROCm 10.0、OpenVINO、SYCL 和 Vulkan
  • Windows x64 和 arm64,支持 CPU、OpenCL Adreno、CUDA 12/13、Vulkan、OpenVINO、SYCL 和 ROCm 10.0
  • Android arm64,适用于 CPU 和 Snapdragon(CPU、Adreno GPU、Hexagon NPU)
  • Linux arm64,适用于包括 CPU、Adreno GPU 和 Hexagon NPU 在内的 Snapdragon 设备
  • 还提供独立的 UI 构建版本。

此次更新使用户能够在广泛架构上运行 llama.cpp,特别是通过新的直接映射 DMA 缓存改善了对搭载 Hexagon NPUs 的 Qualcomm Snapdragon 处理器的支持。