Le projet llama.cpp a publié la version b11310, qui comprend une correction pour la logique de déquantisation IQ4_NL du backend CUDA. La mise à jour traite un problème de sécurité mémoire où les threads pouvaient lire et écrire au-delà de la fin d'une ligne lors du traitement de blocs plus courts que QK_K.
- Protège le noyau de déquantisation de ligne iq4_nl contre les lignes courtes en sautant les sous-blocs qui commencent à ou après la longueur de la ligne.
- Fournit des binaires préconstruits pour macOS (Apple Silicon et Intel), Linux, Windows, Android et openEuler via les backends CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL et Snapdragon.
Cette correction empêche un accès mémoire hors limites potentiel lors de l'inférence avec des modèles quantisés IQ4_NL sur des appareils CUDA.