Проект llama.cpp выпустил версию b10840, которая вводит оптимизации производительности для вывода CUDA. Обновление реализует вычисления без ветвления для форматов квантования Q4_K и Q5_K для ускорения умножения матрицы на вектор (mmvq).
- Безветвление распаковки предотвращает повторное выполнение масштабирования для каждого столбца в mmvq, улучшая производительность при размерах батча больше 1.
- Логика предвыборки L2 включается специально для оборудования DGX Spark, чтобы гарантировать реализацию преимуществ.
- Охранник предвыборки L2 mmvq расширен для поддержки бэкендов MUSA и HIP наряду с CUDA.
- Точки переключения для Q4_K обновлены для поддержки более широкого диапазона моделей.
Эти изменения обеспечивают измеримые улучшения производительности для пользователей, запускающих llama.cpp на системах DGX Spark с размерами батча больше одного.