llama.cpp 项目已为 OpenCL 添加了 A8 Q8_0 non-MoE dp4a 二进制内核。

  • 该更改在 ggml-org/llama.cpp 仓库中作为拉取请求 #29439 进行跟踪。
  • 它在 OpenCL 后端中引入了对特定量化格式 (A8 Q8_0) 的支持,使用 dp4a 指令集。