Le projet llama.cpp a ajouté un noyau binaire A8 Q8_0 non-MoE dp4a pour OpenCL.
- Le changement est suivi en tant que pull request #29439 dans le dépôt ggml-org/llama.cpp.
- Il introduit la prise en charge d'un format de quantification spécifique (A8 Q8_0) en utilisant l'ensemble d'instructions dp4a au sein du backend OpenCL.