O projeto llama.cpp lançou a versão b10099, que inclui uma atualização significativa no backend do CUDA para melhorar a quantização de ativação NVFP4 W4A4.
- Kernels fundidos de amax por canal e quantização para melhor desempenho.
- Adicionado suporte para intrínsecos nvfp4x4 quando disponíveis em hardware NVIDIA.
- Busca de escala otimizada com intrínsecos e cálculos de amax por bloco restaurados.
- Implementadas cargas de 32 bytes e otimizações de aritmética de ponteiros para reduzir a sobrecarga.
- Uso de builtin_align(32) estruturado protegido especificamente para NVIDIA, observando problemas de compatibilidade HIP.
Este lançamento fornece binários atualizados para macOS, Linux, Windows, Android e openEuler através de CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL e outros backends.