A NVIDIA lançou dois artefatos de código aberto projetados para construir agentes de IA sempre ativos: o modelo Nemotron 3.5 Lightning e a biblioteca de roteamento NeMo Switchyard. Essas ferramentas abordam o alto custo e a latência de enviar cada etapa de fluxos de trabalho de agentes de longa duração para modelos de raciocínio de ponta, fornecendo capacidades especializadas de execução e roteamento.
O Nemotron 3.5 Lightning é um modelo mixture-of-experts de 30B com 3B parâmetros ativos, apresentando uma arquitetura híbrida Mamba-2 + MoE + Attention e uma janela de contexto de 1M tokens. Ele alcança velocidade de saída até 4x mais rápida do que modelos de tamanho semelhante e conclui tarefas do PinchBench 30% mais rápido do que o Qwen3.6 35B com precisão comparável.
O NeMo Switchyard é uma biblioteca de código aberto que direciona as etapas do fluxo de trabalho do agente para o modelo mais capaz e eficiente disponível, oferecendo roteadores sem necessidade de ajuste, como roteamento de escalonamento e por estágio. Em benchmarks, reduziu os custos em 74% em um teste do LangChain ao enviar apenas 7% das chamadas para modelos de ponta, com a Cognition relatando custos médios menores para o Devin Desktop.
Ambos os artefatos estão geralmente disponíveis sob licenças permissivas, com pesos do Lightning acessíveis no Hugging Face e ModelScope, permitindo implantação em GPUs únicas como a DGX Spark ou H100.