llama.cpp 项目已发布 0.2.0 版本,其中 ggml 库同步升级至 0.21.0。此次更新引入了多项后端改进,并在各种硬件平台上增加了新功能。
- 为兼容硬件添加了 Kleidiai SME2 F32 GEMV 内核支持,以提升性能。
- 启用了 LFM2 和 LFM2MOE 模型的张量分割功能,以改善多 GPU 分布。
- 在模型加载管线中实现了 LFM2 模型的 DSpark 支持。
- 更新了 SYCL 后端,包含 Q2_K 重排序 MMVQ、ESIMD 内核,以及针对 Alchemist GPU 和 mlock 问题的修复。
- 改进了 OpenCL 的稳定性,修复了 Adreno A6x/A7x 编译器和本地大小计算问题。
- 为 mtmd 添加了 --mmproj-device 参数,用于指定多模态投影的设备放置。
该版本还包含 CI 清理、UI 设置导航改进,以及针对 CUDA、Metal 和 Vulkan 后端的各类错误修复。