llama.cpp प्रोजेक्ट ने संस्करण b10704 जारी किया, जो CUDA बैकएंड को किसी भी उपयोग किए गए विशेषज्ञों की संख्या (n_expert_used) के लिए अनुकूलित mm_ids_helper पथ का उपयोग करने के लिए अपडेट करता है। पहले, यह तेज़ पथ warp आकार की विभाज्यता नियमों द्वारा सीमित था, जिससे अधिकांश गणनाएँ धीमी सामान्य कार्यान्वयन पर वापस चली जाती थीं।

  • अनुकूलन अगली द्विघात शक्ति तक पैडिंग को सामान्य बनाता है, n_expert_used = 10 जैसे मामलों को तेज़ पथ का उपयोग करने की अनुमति देता है।
  • RTX PRO 6000 पर 55k संदर्भ के साथ 512 विशेषज्ञों और 10 उपयोग किए गए के साथ Qwen3.8-Flash-Next पर मापा गया, प्रॉम्प्ट प्रसंस्करण गति 2334 से बढ़कर प्रति सेकंड 2600 टोकन हो गई।
  • टोकन उत्पादन प्रदर्शन प्रभावित नहीं रहता क्योंकि अनुकूलन बैच किए गए टोकन प्रसंस्करण को लक्षित करता है।

इस बदलाव ने प्रॉम्प्ट प्रसंस्करण के दौरान ओवरहेड को कम करके Mixture of Experts आर्किटेक्चर का उपयोग करने वाले मॉडलों के लिए इनफरेंस लेटेंसी में सुधार किया है।