llama.cpp प्रोजेक्ट ने संस्करण b10212 जारी किया, जिसमें Multi-Token Prediction (MTP) टेंसरों को केवल तभी लोड करने का बदलाव शामिल है जब वे वास्तव में उपयोग किए जाते हैं। यह अपडेट सुनिश्चित करता है कि MTP टेंसर उन शेष मॉडल में लोडिंग के दौरान स्किप कर दिए जाएं जो इस फीचर को सपोर्ट करते हैं लेकिन इसे आवश्यक नहीं मानते।
- उपयोग के आधार पर शर्तों के तहत MTP टेंसर लोड करें।
- उन संगत मॉडल में जहाँ आवश्यकता न हो, MTP लोडिंग स्किप करें।
यह अनुकूलन उन मॉडल में अनावश्यक मेमोरी ओवरहेड को कम करता है जो Multi-Token Prediction का उपयोग नहीं करते हैं।