llama.cpp 项目发布了版本 b10327,其中包含对 CUDA 上量化拷贝内核启动的线程和块计数的修复。此更新解决了在 pull request #26731 中识别出的问题。
- 该版本添加了针对不均匀块计数拷贝情况的测试,以确保正确性。
- 二进制文件适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、ROCm 7.2、OpenVINO、SYCL)、Android、Windows(CPU、OpenCL Adreno、CUDA 12/13、Vulkan、OpenVINO、SYCL、HIP)和 openEuler。
- 还提供了 iOS XCFramework 和独立的 UI 构建版本。
此发布确保了在广泛的受支持平台上,CUDA 硬件上量化拷贝操作的稳定执行。