Проект llama.cpp выпустил версию b10099, которая включает значительное обновление бэкенда CUDA для улучшенного квантования активаций NVFP4 W4A4.

  • Объединённые ядра amax по каналам и квантования для лучшей производительности.
  • Добавлена поддержка встроенных функций nvfp4x4 при наличии на оборудовании NVIDIA.
  • Оптимизирован поиск масштаба с использованием встроенных функций и восстановлены вычисления amax по блокам.
  • Реализованы загрузки по 32 байта и оптимизации арифметики указателей для снижения накладных расходов.
  • Ограничено использование структуры builtin_align(32) специально для NVIDIA, с учётом проблем совместимости HIP.

Этот релиз предоставляет обновлённые бинарные файлы для macOS, Linux, Windows, Android и openEuler для CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL и других бэкендов.