llama.cpp परियोजना ने बिल्ड b10730 जारी किया, जिसमें Qwen4exp मॉडल आर्किटेक्चर के लिए अनुकूलन शामिल हैं। प्राथमिक परिवर्तन में ट्रांसपोज़ और sum_rows ऑपरेशन का उपयोग करने के बजाय स्लाइस के द्वारा indexer हेड्स को जोड़ना शामिल है, जिससे मेमोरी कॉपी ओवरहेड कम होता है।

  • Qwen3.8-Flash-Next UD-Q4_K_XL के साथ RTX PRO 6000 पर प्रॉम्प्ट प्रोसेसिंग गति 2170 से बढ़कर 2366 टोकन प्रति सेकंड हो गई।
  • अनुकूलन indexer क्वेरी के लिए अनावश्यक सतत टेंसर आवश्यकताओं को हटा देता है, क्योंकि rope एक नए आवंटित सतत टेंसर लौटाता है।
  • जनरेशन गति प्रभावित नहीं होती है, लेकिन प्रॉम्प्ट प्रोसेसिंग में लाभ संदर्भ लंबाई और ubatch आकार के साथ स्केल होता है।
  • पिछले संस्करणों की तुलना में ग्रिडी आउटपुट टोकन-दर-टोकन अपरिवर्तित है।

यह अपडेट प्रॉम्प्ट प्रोसेसिंग चरण के दौरान कंप्यूटेशनल बर्बादी को कम करके Qwen4exp मॉडलों से जुड़े लंबे-संदर्भ इनफरेंस कार्यों के लिए दक्षता में सुधार करता है।