O projeto llama.cpp lançou a versão b10099, que inclui uma atualização significativa no backend do CUDA para melhorar a quantização de ativação NVFP4 W4A4.

  • Kernels fundidos de amax por canal e quantização para melhor desempenho.
  • Adicionado suporte para intrínsecos nvfp4x4 quando disponíveis em hardware NVIDIA.
  • Busca de escala otimizada com intrínsecos e cálculos de amax por bloco restaurados.
  • Implementadas cargas de 32 bytes e otimizações de aritmética de ponteiros para reduzir a sobrecarga.
  • Uso de builtin_align(32) estruturado protegido especificamente para NVIDIA, observando problemas de compatibilidade HIP.

Este lançamento fornece binários atualizados para macOS, Linux, Windows, Android e openEuler através de CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL e outros backends.