O projeto llama.cpp lançou a versão b11280, que inclui uma alteração para reduzir a sincronização allreduce de tensores utilizando buffers host fixados.
Esta atualização está disponível em várias plataformas e backends, incluindo macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm 10.0, OpenVINO, SYCL e Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL e ROCm 10.0), Android e iOS.
O lançamento também fornece binários para a interface do llama.cpp.