El proyecto llama.cpp lanzó la versión b10099, que incluye una actualización significativa del backend de CUDA para mejorar la cuantización de activaciones NVFP4 W4A4.
- Núcleos fusionados de amax por canal y cuantización para mejor rendimiento.
- Se añadió soporte para intrínsecos nvfp4x4 cuando están disponibles en hardware NVIDIA.
- Búsqueda de escala optimizada con intrínsecos y restaurados los cálculos de amax por bloque.
- Implementadas cargas de 32 bytes y optimizaciones de aritmética de punteros para reducir la sobrecarga.
- Uso de builtin_align(32) estructurado protegido específicamente para NVIDIA, señalando problemas de compatibilidad HIP.
Esta versión proporciona binarios actualizados para macOS, Linux, Windows, Android y openEuler a través de CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL y otros backends.