O projeto llama.cpp lançou a compilação b11118, que inclui um novo recurso hex-dma introduzindo um cache DMA de mapeamento direto mais adequado para o tratamento de máscaras FA do Hexagon Vector eXtended (HVX).

Esta versão fornece binários e frameworks em várias plataformas e backends de hardware:

  • macOS Apple Silicon (arm64), macOS Intel (x64) e XCFramework iOS
  • Linux Ubuntu x64, arm64, s390x e vários backends de GPU/CPU incluindo CUDA 12/13, ROCm 10.0, OpenVINO, SYCL e Vulkan
  • Windows x64 e arm64 com suporte a CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL e ROCm 10.0
  • Android arm64 para CPU e Snapdragon (CPU, GPU Adreno, NPU Hexagon)
  • Linux arm64 para dispositivos Snapdragon incluindo CPU, GPU Adreno e NPU Hexagon
  • Uma compilação de UI independente também está disponível.

A atualização permite que os usuários executem o llama.cpp em uma ampla gama de arquiteturas, melhorando particularmente o suporte para processadores Qualcomm Snapdragon com NPUs Hexagon por meio do novo cache DMA de mapeamento direto.