NVIDIA는 항상 켜져 있는 AI 에이전트를 구축하기 위해 설계된 두 가지 오픈소스 아티팩트인 Nemotron 3.5 Lightning 모델과 NeMo Switchyard 라우팅 라이브러리를 출시했습니다. 이 도구들은 긴 실행 중인 에이전트 워크플로우의 모든 단계를 최첨단 추론 모델로 전송하는 데 따른 높은 비용과 지연 시간을 전문화된 실행 및 라우팅 기능을 제공하여 해결합니다.
Nemotron 3.5 Lightning은 3B의 활성 파라미터를 가진 30B 혼합 전문가(MoE) 모델로, 하이브리드 Mamba-2 + MoE + Attention 아키텍처와 1M 토큰 컨텍스트 윈도우를 특징으로 합니다. 이 모델은 유사한 크기의 모델보다 최대 4배 빠른 출력 속도를 달성하며, 비슷한 정확도에서 Qwen3.6 35B보다 PinchBench 작업을 30% 더 빠르게 완료합니다.
NeMo Switchyard는 사용 가능한 가장 강력하고 효율적인 모델로 에이전트 워크플로우 단계를 라우팅하는 오픈소스 라이브러리로, 에스컬레이션 및 단계 라우팅과 같은 튜닝이 필요 없는 라우터를 제공합니다. 벤치마크에서 이 라이브러리는 LangChain 테스트에서 호출의 7%만 최첨단 모델로 전송하여 비용을 74% 절감했으며, Cognition은 Devin Desktop에 대해 더 낮은 평균 비용을 보고했습니다.
두 아티팩트 모두 관대한 라이선스 하에 일반적으로 사용 가능하며, Lightning 가중치는 Hugging Face와 ModelScope에서 접근할 수 있어 DGX Spark 또는 H100과 같은 단일 GPU에서 배포를 가능하게 합니다.