llama.cpp 项目发布了版本 b10984,引入了对行连续 SUM_ROWS 操作的 CUDA 支持。此更新还组织了代码以包含 GGML_OP_MEAN,通过共享内核处理行连续张量。
- 为行连续 SUM_ROWS 添加了 CUDA 支持。
- 组织代码以使用共享内核添加 GGML_OP_MEAN 以处理行连续张量。
- 包含了 MEAN 置换和切片操作的测试。
- 提供了适用于 macOS、Linux、Windows、Android 和 openEuler 的二进制文件,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO 和 SYCL 后端。
该发布版确保了与各种硬件加速器和操作系统的兼容性,用于本地推理。