llama.cpp 프로젝트는 CUDA 백엔드의 IQ4_NL 역양자화 로직에 대한 수정 사항을 포함하는 버전 b11310을 출시했습니다. 이 업데이트는 QK_K보다 짧은 블록을 처리할 때 스레드가 행의 끝을 넘어 읽고 쓸 수 있는 메모리 안전 문제를 해결합니다.
- 행 길이에 시작하거나 그 이후에 시작하는 하위 블록을 건너뛰어 짧은 행에 대해 iq4_nl 역양자화 행 커널을 보호합니다.
- CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL 및 Snapdragon 백엔드에 대해 macOS (Apple Silicon 및 Intel), Linux, Windows, Android 및 openEuler용 사전 빌드된 바이너리를 제공합니다.
이 수정 사항은 CUDA 장치에서 IQ4_NL 양자화된 모델로 추론하는 동안 잠재적인 경계 밖 메모리 접근을 방지합니다.