llama.cpp b11372 रिलीज में qwen4exp मॉडल के लाइटनिंग इंडेक्सर के लिए अनुकूलन शामिल हैं, जो मुख्य रूप से लंबे संदर्भ प्रसंस्करण के दौरान इंडेक्सर स्कोर्स के लिए आवश्यक मेमोरी को आधा करने पर केंद्रित है। इसे प्रत्येक हेड के लिए अलग टेंसर बनाने के बजाय हेड स्कोर्स को ही स्थान पर गणना करके हासिल किया गया है।
- qwen4exp इंडेक्सर अब आवंटक बफर्स का पुन: उपयोग करता है और ggml_lightning_indexer के माध्यम से स्कोर्स की गणना करता है, जिससे पीक मेमोरी उपयोग कम होता है।
- 4 हेड्स के साथ लाइटनिंग इंडेक्सर के लिए CUDA बैकएंड सपोर्ट जोड़ा गया है, जिन्हें वेक्टर कर्नेल पर भेजा जाता है।
- मेटल बैकएंड को एक फंक्शन कॉन्स्टेंट से हेड काउंट पढ़ने के लिए अपडेट किया गया है, जिससे बिना कोड में बदलाव किए किसी भी हेड काउंट को चलाया जा सकता है।
- Vulkan बैकएंड शेयरड मेमोरी और fp16 डॉट प्रोडक्ट्स का उपयोग करके लाइटनिंग इंडेक्सर को कीज और टोकन पर टाइल करता है।
ये बदलाव लंबे संदर्भों वाले qwen4exp मॉडल्स के लिए मेमोरी दक्षता में सुधार करते हैं, जबकि कंप्यूट बफर साइज़ और गति को बनाए रखते हैं।