llama.cpp 项目发布了 b10950 版本,对其 ggml-cuda 后端引入了关键更新。此版本通过回退到 FP32 精度,确保与缺乏原生 BFloat16 加速的硬件兼容。
- CUDA 后端现在在缺少 BF16 硬件加速的设备上(Nvidia >= AMPERE 和 AMD >= RDNA3 或 = CDNA)回退至 F32。
- 之前应用于其他架构的逻辑也扩展到了 NVIDIA GPU。
- 为 macOS、Linux、Windows、Android 和 openEuler 提供了 CPU、CUDA、Vulkan、ROCm、OpenVINO 和 SYCL 后端的二进制文件。
此更改允许拥有较旧或特定 GPU 架构的用户运行模型,而不会遇到硬件兼容性问题。