Tim NeMo NVIDIA telah merilis Molt, sebuah kerangka kerja pembelajaran penguatan agentic sumber terbuka yang dirancang untuk mengurangi kompleksitas iterasi algoritma bagi para peneliti. Basis kode ini terdiri dari sekitar 8.6K baris kode RL, jauh lebih kecil dibandingkan kerangka kerja sebanding seperti verl (62K baris) dan slime (25K baris).
- Molt menyusun Ray untuk penempatan, vLLM untuk rollout, dan NVIDIA AutoModel dengan FSDP2 untuk pelatihan tanpa membuat cabang pada komponen hulu.
- Agen diimplementasikan sebagai modul Python standar menggunakan Env yang selaras dengan Gymnasium atau SDK OpenAI/Anthropic bawaan melalui server loopback.
- Kerangka kerja ini menegakkan tiga invarian kebenaran: identitas token, semantik versi kebijakan, dan konsistensi maju, termasuk replai routing rollout untuk model campuran ahli (mixture-of-experts).
- Mendukung penskalaan dari model padat 4B hingga model MoE 700B dan dilengkapi dengan skrip Slurm serta kontainer siap pakai untuk penyebaran pada perangkat keras H100/H200.
Molt bertujuan menyediakan infrastruktur penelitian yang memungkinkan peneliti memahami seluruh basis kode dalam pikiran mereka, memfasilitasi modifikasi estimator dan tahap pipa yang lebih mudah.