NVIDIA发布了两个旨在构建全天候AI智能体的开源组件:Nemotron 3.5 Lightning模型和NeMo Switchyard路由库。这些工具通过提供专门的执行和路由能力,解决了将长运行智能体工作流的每一步都发送到前沿推理模型所带来的高昂成本和延迟问题。

Nemotron 3.5 Lightning是一个拥有30B混合专家(MoE)参数、其中3B为激活参数的模型,采用混合Mamba-2 + MoE + Attention架构以及1M-token上下文窗口。其输出速度比同类模型快多达4倍,在PinchBench任务上的完成速度比Qwen3.6 35B快30%,且精度相当。

NeMo Switchyard是一个开源库,可将智能体工作流步骤引导至最强大且高效的可用模型,提供无需调优的路由器,如升级路由和阶段路由。在基准测试中,它通过将仅7%的调用发送到前沿模型,在LangChain测试中将成本降低了74%,Cognition也报告Devin Desktop的平均成本更低。

这两个组件均在宽松许可下全面可用,Lightning权重可在Hugging Face和ModelScope上获取,支持在DGX Spark或H100等单GPU上进行部署。