NVIDIA выпустила два инструмента с открытым исходным кодом, предназначенных для создания постоянно работающих ИИ-агентов: модель Nemotron 3.5 Lightning и библиотеку маршрутизации NeMo Switchyard. Эти инструменты решают проблему высокой стоимости и задержек при отправке каждого шага долго выполняющихся рабочих процессов агентов в передовые модели рассуждения, предоставляя специализированные возможности выполнения и маршрутизации.

Nemotron 3.5 Lightning — это модель типа mixture-of-experts на 30B параметров с 3B активными параметрами, использующая гибридную архитектуру Mamba-2 + MoE + Attention и контекстное окно на 1M токенов. Она обеспечивает скорость вывода до 4 раз быстрее по сравнению с моделями аналогичного размера и выполняет задачи PinchBench на 30% быстрее, чем Qwen3.6 35B, при сопоставимой точности.

NeMo Switchyard — это библиотека с открытым исходным кодом, которая направляет шаги рабочего процесса агента к наиболее мощной и эффективной доступной модели, предлагая маршрутизаторы без необходимости тонкой настройки, такие как эскалация и маршрутизация по этапам. В тестах benchmarks она снизила затраты на 74% в тесте LangChain, направляя только 7% запросов в передовые модели, а компания Cognition сообщила о более низких средних затратах для Devin Desktop.

Оба инструмента доступны для общего использования под разрешительными лицензиями, веса Lightning доступны на Hugging Face и ModelScope, что позволяет разворачивать их на одних GPU, таких как DGX Spark или H100.