llama.cpp 项目已发布版本 b10989,引入了在 ROCm 后端中启用 AllReduce 操作的支持。此次更新是持续扩展大语言模型推理的硬件兼容性和分布式计算能力的一部分。

  • 该版本包含适用于 macOS(Apple Silicon 和 Intel)、Linux(Ubuntu x64、arm64、s390x)、Windows 和 Android 的预构建二进制文件。
  • GPU 加速选项已扩展,包括 CUDA 12.8/13.3、Vulkan、OpenVINO、SYCL FP32/FP16 以及 ROCm 10.0(在支持的平台上)。
  • 为 openEuler x86 和 aarch64 架构提供了特定构建版本,包括对 910b 处理器上 ACL Graph 的支持。
  • 核心库发布的同时也提供了独立的 UI 二进制文件。

此次发布使用户能够利用支持 AllReduce 功能的基于 ROCm 的 AMD GPU,并为各种操作系统和硬件加速器提供更新的二进制文件。