llama.cpp प्रोजेक्ट ने संस्करण b10718 जारी किया, जिसमें इसके CUDA बैकएंड में एक महत्वपूर्ण अपडेट शामिल है। सबसे उल्लेखनीय बदलाव Mixture of Experts (MOE) फ्यूजन को स्पेकुलेटिव डिकोडिंग (specdec) का समर्थन करने के लिए विस्तारित करना है, जिसने पिछली सीमाओं को दूर किया जहाँ MOE glu फ्यूजन और topk-router फ्यूजन केवल एक समय में एक टोकन प्रसंस्करण तक सीमित थे।

  • CUDA: MOE फ्यूजन को specdec तक विस्तारित किया गया, पहले के MOE glu और topk-router फ्यूजन के लिए सिंगल-टोकन प्रतिबंध को हटाया गया।
  • मल्टी-टोकन MOE फ्यूजन कार्यान्वयन में SWIGLU_CASE समर्थन जोड़ा गया।
  • pull request #27621 से समीक्षा टिप्पणियों को संबोधित किया गया।

यह अपडेट NVIDIA GPU पर अधिक कुशल फ्यूज्ड ऑपरेशन सक्षम करके स्पेकुलेटिव डिकोडिंग का उपयोग करने वाले मॉडल के प्रदर्शन में सुधार करता है।