llama.cpp 项目发布了版本 b10690,其中包含针对未量化键值缓存的关键修复。该更新通过确保仅在分配了缓冲区时才将 Hadamard 矩阵复制到 k_rot 张量,防止了在上下文切换期间发生的崩溃。
- 通过条件性复制 Hadamard 矩阵,修复了上下文切换期间未量化 K cache 的崩溃问题
- 提供适用于 macOS (Apple Silicon 和 Intel)、iOS、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows (CPU、CUDA、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 openEuler 的二进制文件
- 包括界面更新和发布证明