Проект llama.cpp выпустил версию b10840, которая вводит оптимизации производительности для вывода CUDA. Обновление реализует вычисления без ветвления для форматов квантования Q4_K и Q5_K для ускорения умножения матрицы на вектор (mmvq).

  • Безветвление распаковки предотвращает повторное выполнение масштабирования для каждого столбца в mmvq, улучшая производительность при размерах батча больше 1.
  • Логика предвыборки L2 включается специально для оборудования DGX Spark, чтобы гарантировать реализацию преимуществ.
  • Охранник предвыборки L2 mmvq расширен для поддержки бэкендов MUSA и HIP наряду с CUDA.
  • Точки переключения для Q4_K обновлены для поддержки более широкого диапазона моделей.

Эти изменения обеспечивают измеримые улучшения производительности для пользователей, запускающих llama.cpp на системах DGX Spark с размерами батча больше одного.