L'équipe NeMo de NVIDIA a publié Molt, un framework open-source d'apprentissage par renforcement agentic conçu pour réduire la complexité de l'itération des algorithmes pour les chercheurs. La base de code compte environ 8,6K lignes de code RL, nettement inférieure à celle des frameworks comparables comme verl (62K lignes) et slime (25K lignes).

  • Molt compose Ray pour le placement, vLLM pour le rollout, et NVIDIA AutoModel avec FSDP2 pour l'entraînement sans forker les composants en amont.
  • Les agents sont implémentés sous forme de modules Python standard utilisant soit un Env aligné sur Gymnasium, soit les SDK OpenAI/Anthropic via un serveur loopback.
  • Le framework impose trois invariants de correction : l'identité des tokens, la sémantique de version de la politique et la cohérence avant, y compris la relecture du routage de rollout pour les modèles mixture-of-experts.
  • Il prend en charge la mise à l'échelle de modèles denses 4B aux modèles MoE 700B et est livré avec des scripts Slurm et des conteneurs préconstruits pour le déploiement sur du matériel H100/H200.

Molt vise à fournir une infrastructure de recherche permettant aux chercheurs de garder l'ensemble de la base de code dans leur tête, facilitant ainsi la modification des estimateurs et des étapes du pipeline.