llama.cpp ने NVIDIA Nemotron-3-Puzzle-75B-A9B मॉडल के लिए समर्थन पेश किया है, जिससे इस Mixture of Experts आर्किटेक्चर के लिए इनफरेंस सक्षम होता है। अपडेट में वेरिएबल-पर-लेयर एक्सपर्ट फीड-फॉरवर्ड साइज़ और top-k रूटिंग के लिए इंफ्रास्ट्रक्चर लागू किया गया है, जो आवश्यक हैं क्योंकि मॉडल में 40 MoE परतें हैं जिनके n_ff_exp और top-k मान अलग-अलग हैं।

  • स्केलर-या-एरे लोडिंग क्षमताओं के साथ per-layer n_ff_exp और n_expert_used सरणियाँ जोड़ी गईं।
  • परतों के बीच विषम एक्सपर्ट कॉन्फ़िगरेशन को संभालने के लिए G1/G2 इंफ्रास्ट्रक्चर लागू किया गया।
  • आधिकारिक BF16 चेकपॉइंट्स के लिए block_configs को पार्स करने और टेंसर नामों को सामान्यीकृत करने के लिए कन्वर्टर को अपडेट किया गया।
  • per-layer expert_used_count सरणी के आधार पर Nemotron 3 Puzzle को Super वेरिएंट्स से अलग किया गया।

इस बदलाव से llama.cpp को Nemotron-3-Puzzle मॉडल लोड और चलाने की अनुमति मिलती है, जो पहले अपनी जटिल, असमान MoE संरचना के कारण समर्थन से वंचित था।