Проект llama.cpp выпустил сборку b10534, которая вводит аппаратно-специфичные точки переключения для настройки перехода между путями векторных и тензорных ядер во время квантованного декодирования на CUDA.

  • В релизе добавлена конфигурация времени выполнения через GGML_CUDA_MMVQ_MAX для настройки порога размера пакета, при котором ядро переключается с mul_mat_vec_q на MMQ.
  • Теперь включены конкретные значения точек переключения для архитектур Blackwell, DGX Spark и Ada, что снижает зависимость от переменных окружения.
  • Снижение этого порога направляет большие пакеты по пути тензорного ядра int8 MMQ, обеспечивая измеренное ускорение на 23-41% при размере пакета 8 для моделей Q4_K dense на RTX 5090.
  • Обновление включает бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, Vulkan, ROCm, OpenVINO и SYCL.

Это изменение улучшает производительность вывода на современных графических процессорах NVIDIA за счёт автоматического выбора наиболее эффективного пути ядра на основе размера пакета и возможностей оборудования.