llama.cpp 项目发布了构建版本 b10754,其中包含针对 Adreno GPU 上 OpenCL 的关键修复,以防止图像处理内核中的越界内存读取。

  • q4_K 解码 GEMV 的行获取现在在填充的 x 网格上进行钳位。
  • 图像 KQ/KQV GEMM 的分块契约得到严格执行。
  • 图像 KQ/KQV 的拆分逻辑在分发时确定,而不是依赖于步幅 (strides)。

此更新确保了在使用 Adreno 硬件和 OpenCL 加速运行 llama.cpp 时的稳定性和正确性。