El proyecto llama.cpp lanzó la versión b11310, que incluye una corrección para la lógica de desquantización IQ4_NL del backend CUDA. La actualización aborda un problema de seguridad de memoria donde los hilos podían leer y escribir más allá del final de una fila al procesar bloques más cortos que QK_K.
- Protege el kernel de desquantización de filas iq4_nl contra filas cortas omitiendo subbloques que comienzan en o más allá de la longitud de la fila.
- Proporciona binarios precompilados para macOS (Apple Silicon e Intel), Linux, Windows, Android y openEuler a través de los backends CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL y Snapdragon.
Esta corrección previene el acceso a memoria fuera de límites potencial durante la inferencia con modelos cuantizados IQ4_NL en dispositivos CUDA.