Le projet llama.cpp a publié la compilation b10889, qui inclut une optimisation de la mémoire pour éviter d'allouer le cache V pour l'indexeur car il n'est pas utilisé.
Cette mise à jour fournit des binaires précompilés pour macOS (Apple Silicon et Intel), iOS, Linux (Ubuntu x64, arm64, s390x avec CPU, Vulkan, ROCm 10.0, OpenVINO et backends SYCL), Android (arm64), Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0) et openEuler.
La version inclut également l'interface utilisateur llama.cpp.