llama.cpp b11265 रिलीज़ में Vulkan बैकएंड द्वारा Mixture of Experts (MoE) मॉडल्स के हैंडलिंग के लिए एक सुधार शामिल है। अपडेट `mat_mul_id` द्वारा मैट्रिक्स गुणा टाइल्स को कैसे चुना जाता है, इसे ठीक करता है, जिससे डिस्पैच के दौरान वर्कर्स के निष्क्रिय रहने की प्रदर्शन समस्या का समाधान होता है।

  • पहले, टाइल चयन कुल टोकन गणना पर निर्भर था, जो MoE डिस्पैच ग्रिड्स के लिए गलत था जहां वर्कग्रुप प्रति सच्चा N प्रति-विशेषज्ञ पंक्तियाँ हैं।
  • Sarvam 30B जैसे मॉडल्स पर pp128 के साथ, इस त्रुटि के कारण पिकर ने 128 के बजाय लगभग 6 सक्रिय पंक्तियों के लिए टाइल्स चुने।
  • सुधार यह सुनिश्चित करता है कि समूह में सभी वर्कर्स के पास काम करने को हो, जिससे पहले जो समय व्यर्थ होता था और जो कार्य की अवधि का 55% था, वह समाप्त हो जाता है।

GPU वर्कर्स के बीच उचित लोड वितरण सुनिश्चित करके यह बदलाव Vulkan पर MoE मॉडल्स के लिए इनफरेंस दक्षता को बढ़ाता है।