Команда NVIDIA NeMo выпустила Molt, фреймворк для агентного обучения с подкреплением с открытым исходным кодом, предназначенный для снижения сложности итераций алгоритмов для исследователей. Базовый код содержит около 8.6K строк RL-кода, что значительно меньше по сравнению со схожими фреймворками, такими как verl (62K строк) и slime (25K строк).
- Molt использует Ray для размещения, vLLM для прогона и NVIDIA AutoModel с FSDP2 для обучения без форка upstream компонентов.
- Агенты реализованы как стандартные Python модули с использованием Gymnasium-aligned Env или стандартных OpenAI/Anthropic SDKs через loopback сервер.
- Фреймворк обеспечивает три инварианта корректности: тождественность токенов, семантику версий политики и forward consistency, включая replay маршрутизации прогона для моделей mixture-of-experts.
- Он поддерживает масштабирование от плотных 4B моделей до 700B MoE моделей и поставляется со скриптами Slurm и готовыми контейнерами для развертывания на оборудовании H100/H200.
Molt стремится предоставить исследовательскую инфраструктуру, позволяющую исследователям держать весь базовый код в голове, облегчая модификацию оценщиков и этапов конвейера.