O projeto llama.cpp lançou a versão b11310, que inclui uma correção para a lógica de desquantização IQ4_NL do backend CUDA. A atualização aborda um problema de segurança de memória onde as threads podiam ler e escrever além do final de uma linha ao processar blocos mais curtos que QK_K.
- Protege o kernel de desquantização de linhas iq4_nl contra linhas curtas, pulando sub-blocos que começam no comprimento da linha ou além dele.
- Fornece binários pré-compilados para macOS (Apple Silicon e Intel), Linux, Windows, Android e openEuler através dos backends CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL e Snapdragon.
Esta correção previne acesso à memória fora dos limites potencial durante a inferência com modelos quantizados IQ4_NL em dispositivos CUDA.