llama.cpp प्रोजेक्ट ने संस्करण b11310 जारी किया, जिसमें CUDA backend के IQ4_NL dequantization तर्क के लिए एक सुधार शामिल है। अपडेट एक मेमोरी सुरक्षा मुद्दे को संबोधित करता है जहाँ थ्रेड्स QK_K से छोटे ब्लॉकों को प्रोसेस करते समय पंक्ति के अंत से आगे पढ़ और लिख सकते थे।
- iq4_nl dequantize row kernel को छोटी पंक्तियों से सुरक्षित करता है, पंक्ति लंबाई पर या उससे आगे शुरू होने वाले सब-ब्लॉकों को छोड़कर।
- CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL और Snapdragon backends के लिए macOS (Apple Silicon और Intel), Linux, Windows, Android और openEuler के लिए पूर्व-निर्मित बाइनरी प्रदान करता है।
यह सुधार CUDA उपकरणों पर IQ4_NL क्वांटाइज्ड मॉडल के साथ इनफरेंस के दौरान संभावित आउट-ऑफ-बाउंड्स मेमोरी एक्सेस को रोकता है।