llama.cpp 项目已发布 b10312 版本,其中包含对服务器组件的特定更新。主要更改解决了繁忙模型被路由器驱逐的问题。
- 服务器:防止驱逐繁忙模型(PR #26567)。
- macOS/iOS:提供适用于 Apple Silicon (arm64) 和 Intel (x64) 的二进制文件,以及 iOS XCFramework。macOS 上的 KleidiAI 支持已禁用。
- Linux:提供适用于 Ubuntu x64、arm64 和 s390x CPU 的构建版本,以及 Vulkan、ROCm 7.2、OpenVINO、SYCL FP32 和 SYCL FP16 变体。
- Android:包含 arm64 CPU 构建版本。
- Windows:支持 x64 和 arm64 CPU、OpenCL Adreno、CUDA 12/13、Vulkan、OpenVINO、SYCL 和 HIP。
- openEuler:提供适用于 x86 (310p, 910b ACL Graph) 和 aarch64 (310p, 910b ACL Graph) 的构建版本,而标准拉取请求已禁用。
此发布确保了服务器部署中活跃模型的持续可用性,并在主要操作系统和硬件加速器上提供了全面的二进制文件。