Проект llama.cpp добавил бинарное ядро A8 Q8_0 non-MoE dp4a для OpenCL.

  • Изменение отслеживается как pull request #29439 в репозитории ggml-org/llama.cpp.
  • Оно добавляет поддержку конкретного формата квантования (A8 Q8_0) с использованием набора инструкций dp4a во внутреннем бэкенде OpenCL.