Проект llama.cpp выпустил версию b10099, которая включает значительное обновление бэкенда CUDA для улучшенного квантования активаций NVFP4 W4A4.
- Объединённые ядра amax по каналам и квантования для лучшей производительности.
- Добавлена поддержка встроенных функций nvfp4x4 при наличии на оборудовании NVIDIA.
- Оптимизирован поиск масштаба с использованием встроенных функций и восстановлены вычисления amax по блокам.
- Реализованы загрузки по 32 байта и оптимизации арифметики указателей для снижения накладных расходов.
- Ограничено использование структуры builtin_align(32) специально для NVIDIA, с учётом проблем совместимости HIP.
Этот релиз предоставляет обновлённые бинарные файлы для macOS, Linux, Windows, Android и openEuler для CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL и других бэкендов.