El equipo de NeMo de NVIDIA ha lanzado Molt, un framework de aprendizaje por refuerzo agéntico de código abierto diseñado para reducir la complejidad de la iteración de algoritmos para investigadores. La base de código tiene aproximadamente 8.6K líneas de código RL, significativamente menor que frameworks comparables como verl (62K líneas) y slime (25K líneas).

  • Molt compone Ray para la colocación, vLLM para el rollout, y NVIDIA AutoModel con FSDP2 para el entrenamiento sin bifurcar los componentes upstream.
  • Los agentes se implementan como módulos estándar de Python utilizando un Env alineado con Gymnasium o SDKs estándar de OpenAI/Anthropic a través de un servidor de bucle invertido.
  • El framework impone tres invariantes de corrección: identidad del token, semántica de la versión de la política y consistencia hacia adelante, incluyendo el replay de enrutamiento de rollout para modelos mixture-of-experts.
  • Soporta escalado desde modelos densos de 4B hasta modelos MoE de 700B y se entrega con scripts de Slurm y contenedores preconstruidos para implementación en hardware H100/H200.

Molt tiene como objetivo proporcionar infraestructura de investigación que permita a los investigadores mantener toda la base de código en su cabeza, facilitando la modificación más fácil de estimadores y etapas del pipeline.