NVIDIA ha lanzado dos artefactos de código abierto diseñados para construir agentes de IA siempre activos: el modelo Nemotron 3.5 Lightning y la biblioteca de enrutamiento NeMo Switchyard. Estas herramientas abordan el alto costo y la latencia de enviar cada paso de los flujos de trabajo de agentes de larga duración a modelos de razonamiento de vanguardia, proporcionando capacidades especializadas de ejecución y enrutamiento.

Nemotron 3.5 Lightning es un modelo mixture-of-experts de 30B con 3B parámetros activos, que cuenta con una arquitectura híbrida Mamba-2 + MoE + Attention y una ventana de contexto de 1M tokens. Alcanza hasta 4 veces más velocidad de salida que modelos de tamaño similar y completa las tareas de PinchBench un 30% más rápido que Qwen3.6 35B con precisión comparable.

NeMo Switchyard es una biblioteca de código abierto que dirige los pasos del flujo de trabajo del agente hacia el modelo más capaz y eficiente disponible, ofreciendo enrutadores sin ajuste como el enrutamiento de escalación y por etapas. En las pruebas de referencia, redujo los costos un 74% en una prueba de LangChain al enviar solo el 7% de las llamadas a modelos de vanguardia, con Cognition reportando costos medios más bajos para Devin Desktop.

Ambos artefactos están disponibles generalmente bajo licencias permisivas, con los pesos de Lightning accesibles en Hugging Face y ModelScope, lo que permite la implementación en GPUs individuales como DGX Spark o H100.