llama.cpp 项目已更新其 OpenCL 后端,以改善两代 Adreno GPU 上的矩阵乘法性能。这些更改主要针对 X2E 代,默认启用 xmem F16xF32 GEMM 路径,并优化了 A7X 代的处理。

  • 为 X2E 设备默认启用 Adreno xmem F16xF32 GEMM,此前需要选择加入的环境变量。
  • 通过将批处理操作路由到逐行内核,绕过 Adreno A7X 编译器上的分块 f32 GEMM,以避免寄存器溢出问题。
  • xmem 优化为 Adreno X2-90 设备上的 gpt-oss-20b 提供了约 25% 的预填充加速,而 A7X 的绕过方案在 gemma-3n-E4B 上带来了约 9% 的提升。

这些优化解决了新旧 Adreno 芯片组中特定的编译器低效问题,减少了模型预填充阶段在缓慢的矩阵乘法内核中消耗的 GPU 时间。