llama.cpp 项目发布了版本 b10412,引入了对 dflash 和 dspark 后端的支持。此更新还允许在后端采样逻辑中使用大于 0 的 p_min 值,并添加了相应的保护措施。
- 为 dflash 和 dspark 启用后端采样。
- 在添加保护机制的情况下,允许后端采样中 p_min > 0。
- 提供适用于 macOS (Apple Silicon 和 Intel)、Linux (CPU、Vulkan、OpenVINO、SYCL)、Windows (CPU、CUDA、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 openEuler 的二进制文件。
此发布扩展了 llama.cpp 用户可用的硬件加速选项。