llama.cpp 项目发布了版本 b11310,其中包含对 CUDA 后端的 IQ4_NL 反量化逻辑的修复。该更新解决了内存安全问题,即在处理短于 QK_K 的块时,线程可能会读取和写入超出行末尾的数据。

  • 通过跳过从行长度开始或超过行长度的子块,保护 iq4_nl 反量化行内核免受短行影响。
  • 为 macOS(Apple Silicon 和 Intel)、Linux、Windows、Android 和 openEuler 提供预构建的二进制文件,支持 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 和 Snapdragon 后端。

此修复防止了在 CUDA 设备上使用 IQ4_NL 量化模型进行推理时潜在的越界内存访问。