llama.cpp 项目发布了版本 b10246,其中包括针对特定模型配置的 OpenCL 性能修复。此更新解决了原始维度条件不足以处理大型权重的问题。
- 将大型 q6_K lm_head 张量路由到扁平 GEMV 而非 gemv_noshuffle。
- 添加了直接的大小条件以防止像 gemma-4 E2B(维度为 [1536, 262144])这样的模型出现性能下降。
- 提供适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、CUDA、Vulkan、OpenVINO、SYCL、HIP)和 openEuler 的二进制文件。
此更改确保在 OpenCL 设备上高效处理大型权重矩阵,而不会触发性能瓶颈。