NVIDIAは、常時稼働するAIエージェントの構築のために設計された2つのオープンソースアーティファクト——Nemotron 3.5 LightningモデルとNeMo Switchyardルーティングライブラリ——をリリースした。これらのツールは、長時間実行されるエージェントワークフローのすべてのステップをフロンティア推論モデルに送信することに伴う高コストとレイテンシーの問題に対し、専門的な実行およびルーティング機能を提供することで対処している。

Nemotron 3.5 Lightningは、3Bのアクティブパラメータを持つ30BのMixture-of-Expertsモデルであり、ハイブリッドなMamba-2 + MoE + Attentionアーキテクチャと1Mトークンのコンテキストウィンドウを特徴とする。同規模のモデルと比較して最大4倍の高速な出力速度を実現し、同等の精度でQwen3.6 35BよりもPinchBenchタスクを30%高速に完了する。

NeMo Switchyardは、エージェントワークフローのステップを最も能力が高く効率的な利用可能なモデルに振り向けるオープンソースライブラリであり、エスカレーションやステージルーティングなどのチューニング不要のルーターを提供する。ベンチマークでは、LangChainテストにおいてフロンティアモデルへの呼び出しを7%のみ送信することでコストを74%削減し、CognitionはDevin Desktopにおいてより低い平均コストを報告している。

両アーティファクトは緩和ライセンスの下で一般公開されており、Lightningの重みはHugging FaceおよびModelScopeで入手可能であり、DGX SparkやH100のような単一GPUでのデプロイを可能にする。