Релиз llama.cpp b10089 расширяет операции CUDA GET_ROWS для поддержки форматов квантования k-quants, i-quants и mxfp4. Это изменение гарантирует, что все квантованные типы GGML теперь могут использовать прямой путь устройства для поиска встраиваний.

  • Добавлена поддержка k-quant (q2_K до q6_K) для обработки общих рецептов GGUF, таких как Q4_K_M.
  • Расширены общие деквантоваторы суперблоков до девяти i-quants с компоновкой из 32 потоков.
  • Деквантоватор mxfp4 перемещен в общие вспомогательные модули, закрывая покрытие типов GET_ROWS на CUDA.
  • Проверки размера строки включаются только для типов подблоков из 32 значений (iq4_nl и mxfp4), чтобы предотвратить ненужное возвращение на хост.

Предотвращая падение планировщика обратно на хост для этих типов квантования, обновление избегает копирования полной матрицы встраиваний обратно при каждом токене в графах одного устройства.