NVIDIA의 NeMo 팀은 연구자들의 알고리즘 반복 작업을 단순화하기 위해 설계된 오픈소스 에이전트 강화 학습 프레임워크인 Molt를 출시했습니다. 이 코드베이스는 약 8.6K 줄의 RL 코드로 구성되어 있으며, verl(62K 줄)과 slime(25K 줄)과 같은 유사한 프레임워크에 비해 훨씬 작습니다.
- Molt는 Ray를 배치에, vLLM을 롤아웃에, NVIDIA AutoModel with FSDP2를 훈련에 각각 활용하며, 상위 컴포넌트를 포크하지 않습니다.
- 에이전트는 Gymnasium 호환 Env 또는 루프백 서버를 통해 표준 OpenAI/Anthropic SDK를 사용하는 일반 Python 모듈로 구현됩니다.
- 이 프레임워크는 토큰 식별, 정책 버전 의미론, 순방향 일관성을 포함한 롤아웃 라우팅 리플레이(혼합 전문가 모델용) 등 세 가지 정확성 불변식을 강제합니다.
- 밀집형 4B 모델부터 700B MoE 모델까지 확장성을 지원하며, H100/H200 하드웨어에서 배포하기 위한 Slurm 스크립트와 사전 빌드된 컨테이너를 제공합니다.
Molt는 연구자들이 전체 코드베이스를 머릿속에 담을 수 있는 연구 인프라를 제공하여 추정치 및 파이프라인 단계의 수정을 용이하게 하는 것을 목표로 합니다.