llama.cpp b10089 रिलीज ने CUDA GET_ROWS ऑपरेशन को k-quants, i-quants और mxfp4 क्वांटीज़ेशन फॉर्मेट्स का समर्थन करने के लिए विस्तारित किया है। इस बदलाव से यह सुनिश्चित होता है कि सभी क्वांटाइज्ड GGML प्रकार अब एम्बेडिंग खोजों के लिए सीधे डिवाइस पथ ले सकते हैं।
- सामान्य GGUF रेसिपी जैसे Q4_K_M को संभालने के लिए k-quant समर्थन (q2_K से q6_K) जोड़ा गया है।
- 32-थ्रेड लेआउट के साथ नौ i-quants तक साझा सुपर-ब्लॉक डिक्वांटाइज़र्स को विस्तारित किया गया है।
- mxfp4 डिक्वांटाइज़र को साझा हेल्पर्स में स्थानांतरित कर दिया गया है, जिससे CUDA पर GET_ROWS प्रकार कवरेज बंद हो जाता है।
- अनावश्यक होस्ट फॉलबैक से बचने के लिए केवल 32-मूल्य सब-ब्लॉक प्रकारों (iq4_nl और mxfp4) के लिए पंक्ति आकार जांच को गेट किया गया है।
इन क्वांटीज़ेशन प्रकारों के लिए शेड्यूलर को होस्ट पर वापस गिरने से रोककर, अपडेट प्रत्येक टोकन में सिंगल-डिवाइस ग्राफ़ में पूर्ण एम्बेडिंग मैट्रिक्स को वापस कॉपी करने से बचता है।