Проект llama.cpp выпустил версию b11280, которая включает изменение для снижения синхронизации allreduce тензоров за счет использования буферов на хосте с фиксированной страницей.
Это обновление доступно на нескольких платформах и бэкендах, включая macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm 10.0, OpenVINO, SYCL и Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL и ROCm 10.0), Android и iOS.
Выпуск также предоставляет бинарные файлы для llama.cpp UI.