llama.cpp परियोजना ने Vulkan mul_mat_id संचालन के लिए hoisted row-id सीमा को 256 विशेषज्ञों से बढ़ाकर 1024 विशेषज्ञ कर दिया है। यह बदलाव Qwen3.8-Flash-Next जैसे बड़े विशेषज्ञ गणना वाले मॉडलों में प्रदर्शन की बाधाओं को दूर करता है, जो पहले साझा सरणी आकार की सीमाओं के कारण धीमी कोड पथ पर चलते थे।

अपडेट count_experts.comp शेडर को 1024 का MAX_EXPERTS स्थिरांक उपयोग करने के लिए संशोधित करता है, जिससे साझा सरणियाँ 12 KiB तक बढ़ती हैं जबकि Vulkan की 16 KiB गारंटी के भीतर रहती हैं। Strix Halo हार्डवेयर पर 2048 के बैच आकार के साथ, iq3_s के लिए विशेषज्ञ मैट्रिक्स गुणा 12.5 से घटकर 9.5 ms हो जाते हैं और iq4_nl के लिए 14.0 से घटकर 7.5 ms प्रति संचालन। 8k टोकन पर प्रॉम्प्ट प्रसंस्करण गति में लगभग 19% की सुधार होती है, और नए 1024-विशेषज्ञ मामलों के साथ MUL_MAT_ID बैकएंड टेस्ट पास हो जाते हैं।

इस अनुकूलन से llama.cpp Vulkan-अनुकूल हार्डवेयर पर प्रदर्शन में गिरावट के बिना पिछली 512-विशेषज्ञ सीमा को पार करने वाले मॉडलों को कुशलता से संभाल सकता है।