NVIDIA ने हमेशा-सक्रिय AI एजेंट्स बनाने के लिए डिज़ाइन किए गए दो ओपन-सोर्स आर्टिफैक्ट जारी किए हैं: Nemotron 3.5 Lightning मॉडल और NeMo Switchyard राउटिंग लाइब्रेरी। ये टूल्स लंबे समय तक चलने वाले एजेंट वर्कफ़्लो के हर चरण को फ्रंटियर रीज़निंग मॉडल में भेजने की उच्च लागत और लेटेन्सी को विशेष निष्पादन और राउटिंग क्षमताएं प्रदान करके दूर करते हैं।

Nemotron 3.5 Lightning एक 30B मिक्स्चर-ऑफ़-एक्सपर्ट्स मॉडल है जिसमें 3B सक्रिय पैरामीटर हैं, और इसमें हाइब्रिड Mamba-2 + MoE + Attention आर्किटेक्चर और 1M-टोकन संदर्भ विंडो शामिल है। यह समान आकार के मॉडल की तुलना में आउटपुट गति में 4x तक तेज़ी हासिल करता है और समान सटीकता पर Qwen3.6 35B की तुलना में PinchBench कार्यों को 30% तेज़ी से पूरा करता है।

NeMo Switchyard एक ओपन-सोर्स लाइब्रेरी है जो एजेंट वर्कफ़्लो चरणों को उपलब्ध सबसे सक्षम और कुशल मॉडल की ओर निर्देशित करती है, जिसमें एस्केलेशन और स्टेज राउटिंग जैसे ट्यूनिंग-मुक्त राउटर शामिल हैं। बेंचमार्क में, इसने फ्रंटियर मॉडल में केवल 7% कॉल्स भेजकर एक LangChain टेस्ट में लागत को 74% कम कर दिया, जबकि Cognition ने Devin Desktop के लिए कम माध्य लागत की रिपोर्ट की है।

दोनों आर्टिफैक्ट परमिसिव लाइसेंस के तहत सामान्य रूप से उपलब्ध हैं, जिनमें Lightning वजन Hugging Face और ModelScope पर उपलब्ध हैं, जो DGX Spark या H100 जैसे सिंगल GPU पर डिप्लॉयमेंट को सक्षम बनाते हैं।