Проект llama.cpp выпустил версию b11310, которая включает исправление логики деquantизации IQ4_NL для бэкенда CUDA. Обновление устраняет проблему безопасности памяти, при которой потоки могли читать и записывать данные за пределами конца строки при обработке блоков короче QK_K.
- Защищает ядро деquantизации строк iq4_nl от коротких строк путем пропуска подблоков, начинающихся на длине строки или за ее пределами.
- Предоставляет предварительно собранные бинарные файлы для macOS (Apple Silicon и Intel), Linux, Windows, Android и openEuler для CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL и Snapdragon бэкендов.
Это исправление предотвращает потенциальный выход за пределы памяти при выводе с моделями, квантованными IQ4_NL, на устройствах CUDA.