llama.cpp 项目发布了版本 b10538,在 metal 后端引入了关键优化。此更新仅针对大批量大小启用键值 (KV) 缓存的去量化。
- 主要更改在于 metal 后端,现在仅在处理大批量时应用去量化的 KV 缓存。
- 提供适用于 macOS (Apple Silicon 和 Intel)、iOS、Linux (CPU、Vulkan、OpenVINO、SYCL)、Android、Windows (CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm) 和 openEuler 的二进制文件。
- 此版本禁用了 macOS Apple Silicon 上的 KleidiAI 支持和 Ubuntu 上的 ROCm 7.14。
此优化旨在提高兼容硬件上涉及大批量大小的工作负载的内存效率或性能。