O projeto llama.cpp adicionou um kernel binário A8 Q8_0 non-MoE dp4a para OpenCL.
- A alteração é rastreada como pull request #29439 no repositório ggml-org/llama.cpp.
- Introduz suporte para um formato de quantização específico (A8 Q8_0) usando o conjunto de instruções dp4a dentro do backend OpenCL.