llama.cpp 项目发布了版本 b11280,其中包括通过使用固定主机缓冲区来减少张量 allreduce 同步的更改。
此更新适用于多个平台和后端,包括 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL 和 Snapdragon)、Windows(CPU、OpenCL、CUDA 12/13、Vulkan、OpenVINO、SYCL 和 ROCm 10.0)、Android 和 iOS。
该版本还为 llama.cpp UI 提供了二进制文件。