NVIDIA a publié deux artefacts open-source conçus pour construire des agents IA toujours actifs : le modèle Nemotron 3.5 Lightning et la bibliothèque de routage NeMo Switchyard. Ces outils répondent au coût élevé et à la latence liés à l'envoi de chaque étape des workflows d'agents longue durée vers des modèles de raisonnement de pointe, en offrant des capacités d'exécution et de routage spécialisées.
Nemotron 3.5 Lightning est un modèle mixture-of-experts de 30B avec 3B paramètres actifs, doté d'une architecture hybride Mamba-2 + MoE + Attention et d'une fenêtre de contexte de 1M tokens. Il atteint une vitesse de sortie jusqu'à 4x plus rapide que les modèles de taille similaire et termine les tâches PinchBench 30% plus vite que Qwen3.6 35B à précision comparable.
NeMo Switchyard est une bibliothèque open-source qui dirige les étapes du workflow des agents vers le modèle le plus capable et efficace disponible, offrant des routeurs sans réglage comme le routage d'escalade et par étape. Dans les benchmarks, il a réduit les coûts de 74% dans un test LangChain en envoyant seulement 7% des appels aux modèles de pointe, Cognition signalant des coûts moyens inférieurs pour Devin Desktop.
Les deux artefacts sont généralement disponibles sous des licences permissives, les poids Lightning étant accessibles sur Hugging Face et ModelScope, permettant le déploiement sur des GPU uniques comme le DGX Spark ou le H100.