llama.cpp プロジェクトはバージョン b11310 をリリースし、CUDA バックエンドの IQ4_NL デ量子化ロジックの修正が含まれています。この更新は、QK_K より短いブロックを処理する際にスレッドが行の末尾を超えて読み書きする可能性のあるメモリ安全性の問題に対処します。
- 行長に始まるかそれ以降に始まるサブブロックをスキップすることで、短い行に対して iq4_nl デ量子化行カーネルを保護します。
- CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL、および Snapdragon バックエンド across macOS (Apple Silicon および Intel)、Linux、Windows、Android、および openEuler 用のビルド済みバイナリを提供します。
この修正により、CUDA デバイスで IQ4_NL 量子化モデルを使用して推論する際の潜在的な境界外メモリアクセスを防ぎます。