Proyek llama.cpp merilis versi b11310, yang mencakup perbaikan untuk logika dequantisasi IQ4_NL pada backend CUDA. Pembaruan ini mengatasi masalah keamanan memori di mana thread dapat membaca dan menulis melewati akhir baris saat memproses blok yang lebih pendek dari QK_K.

  • Melindungi kernel dequantisasi baris iq4_nl terhadap baris pendek dengan melewati sub-blok yang dimulai pada atau setelah panjang baris.
  • Menyediakan binaris pra-dibangun untuk macOS (Apple Silicon dan Intel), Linux, Windows, Android, dan openEuler di seluruh backend CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL, dan Snapdragon.

Perbaikan ini mencegah akses memori di luar batas yang berpotensi terjadi selama inferensi dengan model terkuantisasi IQ4_NL pada perangkat CUDA.