Le projet llama.cpp a publié la version b11280, qui inclut une modification pour réduire la synchronisation allreduce des tenseurs en utilisant des tampons hôtes épinglés.
Cette mise à jour est disponible sur plusieurs plateformes et backends, y compris macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm 10.0, OpenVINO, SYCL et Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL et ROCm 10.0), Android et iOS.
La version fournit également des binaires pour l'interface utilisateur de llama.cpp.