A equipe NeMo da NVIDIA lançou o Molt, um framework de aprendizado por reforço agêntico de código aberto projetado para reduzir a complexidade da iteração de algoritmos para pesquisadores. A base de código possui aproximadamente 8,6K linhas de código RL, significativamente menor do que frameworks comparáveis como verl (62K linhas) e slime (25K linhas).
- O Molt compõe o Ray para posicionamento, vLLM para rollout e NVIDIA AutoModel com FSDP2 para treinamento sem bifurcar componentes upstream.
- Os agentes são implementados como módulos Python padrão usando um Env alinhado ao Gymnasium ou SDKs padrão da OpenAI/Anthropic por meio de um servidor loopback.
- O framework impõe três invariantes de correção: identidade do token, semântica de versão da política e consistência direta, incluindo replay de roteamento de rollout para modelos mixture-of-experts.
- Ele suporta escalabilidade de modelos densos de 4B até modelos MoE de 700B e vem com scripts Slurm e contêineres pré-construídos para implantação em hardware H100/H200.
O Molt visa fornecer infraestrutura de pesquisa que permita aos pesquisadores manter toda a base de código em sua mente, facilitando a modificação de estimadores e etapas do pipeline.