Le projet llama.cpp a publié la version b11118, qui inclut une nouvelle fonctionnalité hex-dma introduisant un cache DMA à mappage direct mieux adapté à la gestion des masques FA Hexagon Vector eXtended (HVX).
Cette version fournit des binaires et des frameworks sur plusieurs plateformes et backends matériels :
- macOS Apple Silicon (arm64), macOS Intel (x64) et iOS XCFramework
- Linux Ubuntu x64, arm64, s390x et divers backends GPU/CPU incluant CUDA 12/13, ROCm 10.0, OpenVINO, SYCL et Vulkan
- Windows x64 et arm64 avec prise en charge du CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL et ROCm 10.0
- Android arm64 pour le CPU et Snapdragon (CPU, GPU Adreno, NPU Hexagon)
- Linux arm64 pour les appareils Snapdragon incluant CPU, GPU Adreno et NPU Hexagon
- Une version autonome de l'interface utilisateur est également disponible.
La mise à jour permet aux utilisateurs d'exécuter llama.cpp sur un large éventail d'architectures, améliorant particulièrement la prise en charge des processeurs Qualcomm Snapdragon avec les NPU Hexagon grâce au nouveau cache DMA à mappage direct.