Proyek llama.cpp telah merilis versi b11280, yang mencakup perubahan untuk mengurangi sinkronisasi allreduce tensor dengan memanfaatkan buffer host yang dipin.
Pembaruan ini tersedia di berbagai platform dan backend, termasuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm 10.0, OpenVINO, SYCL, dan Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, dan ROCm 10.0), Android, dan iOS.
Rilis ini juga menyediakan biner untuk antarmuka llama.cpp.