llama.cpp 项目发布了构建版本 b10069,其中包括针对 Qualcomm Adreno GPU 的特定 OpenCL 更新。主要更改涉及支持 Adreno MUL_MAT 内核的广播操作,并尊重 Q8_0 MUL_MAT 变体的视图偏移量,以在 llama-server 中启用多流功能。
- 为 Adreno GEMM/GEMV noshuffle 内核添加了广播支持。
- 确保正确处理后 Adreno noshuffle GEMM/GEMV 操作的视图偏移量。
- 在 OpenCL 后端实现了通用的 GEMM/GEMV 广播支持。
- 从代码库中删除了不必要的测试和注释。
此更新通过修复关键的核处理问题,提高了与 Adreno 硬件上多流工作负载的兼容性。