Le projet llama.cpp a publié la version b10099, qui comprend une mise à jour significative du backend CUDA pour améliorer la quantification d'activation NVFP4 W4A4.

  • Noyaux fusionnés de amax par canal et de quantification pour de meilleures performances.
  • Ajout du support des intrinsèques nvfp4x4 lorsque disponibles sur le matériel NVIDIA.
  • Recherche d'échelle optimisée avec des intrinsèques et calculs de amax par bloc restaurés.
  • Implémentation de chargements de 32 octets et d'optimisations d'arithmétique de pointeurs pour réduire la surcharge.
  • Utilisation de builtin_align(32) protégée spécifiquement pour NVIDIA, avec des problèmes de compatibilité HIP notés.

Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et openEuler via CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL et d'autres backends.