Proyek llama.cpp merilis versi b10099, yang mencakup pembaruan signifikan pada backend CUDA untuk peningkatan kuantisasi aktivasi NVFP4 W4A4.
- Kernel amax per-saluran dan kuantisasi yang digabungkan untuk kinerja yang lebih baik.
- Menambahkan dukungan untuk intrinsik nvfp4x4 saat tersedia pada perangkat keras NVIDIA.
- Pencarian skala dioptimalkan dengan intrinsik dan perhitungan amax per-blok dipulihkan.
- Memuat 32 byte dan optimasi aritmetika pointer diterapkan untuk mengurangi overhead.
- Penggunaan struktur builtin_align(32) dilindungi khusus untuk NVIDIA, mencatat masalah kompatibilitas HIP.
Rilis ini menyediakan biner yang diperbarui untuk macOS, Linux, Windows, Android, dan openEuler melalui CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL, dan backend lainnya.