llama.cpp 项目发布了构建版本 b10813,引入了使用 xmem SDPA(缩放点积注意力)路径的 Adreno GPU OpenCL 实现。此更新还解决了 GQA 和掩码注意力机制中的数值错误。

  • 添加了用于 OpenCL 加速的 Adreno xmem SDPA 路径。
  • 移除了 Adreno 特定的队列分析覆盖。
  • 修复了 GQA 和掩码注意力中的数值错误。
  • 引入了 GGML_OPENCL_XMEM_SDPA 环境变量来控制该功能。

该版本为 macOS、Linux、Windows、Android 和 openEuler 提供了适用于 CPU、GPU 和专业硬件后端的二进制文件。