llama.cpp परियोजना ने Qwen3.8-Flash-Next (qwen4exp) मॉडल आर्किटेक्चर के लिए समर्थन जोड़ा है, जिसमें हाइपर-कनेक्शन, गेटेड डेल्टा नेट्स, मिक्सचर ऑफ एक्सपर्ट्स और PLE n-ग्राम हैश एम्बेडिंग्स सहित इसके विशिष्ट घटकों को लागू किया गया है।
- qwen4_exp के लिए GGUF प्लंबिंग जोड़ता है, जिसमें कम-रैंक हाइपर-कनेक्शन और PLE एम्बेडिंग्स के लिए टेंसर शामिल हैं।
- हाइपर-कनेक्शन रेसिडुअल स्ट्रीम्स और MoE ब्लॉक्स के साथ डिकोड ग्राफ लागू करता है, जिसे vLLM के खिलाफ उच्च top-1 सहमति के साथ सत्यापित किया गया है।
- बड़े मल्टीप्लायर मानों के कारण 64-बिट पूर्णांक का उपयोग करके PLE n-ग्राम एम्बेडिंग्स के लिए होस्ट-साइड हैशिंग पेश करता है।
- हाइब्रिड मॉडल के लिए QSA स्पार्स एटेंशन सक्षम करने के लिए llama_memory_hybrid में वैकल्पिक इंडेक्सर की कैश समर्थन जोड़ता है।
यह जोड़ा llama.cpp के भीतर Qwen3.8-Flash-Next मॉडल को लोड और इनफरेंस करने की सुविधा देता है, जिससे इसकी आर्किटेक्चर कवरेज बढ़ती है।