NVIDIA के NeMo टीम ने Molt जारी किया है, जो शोधकर्ताओं के लिए एल्गोरिदम पुनरावृत्ति की जटिलता को कम करने के लिए डिज़ाइन किया गया एक ओपन-सोर्स एजेंटिक रीइंफोर्स्मेंट लर्निंग फ्रेमवर्क है। कोडबेस लगभग 8.6K पंक्तियों का RL कोड है, जो verl (62K पंक्तियाँ) और slime (25K पंक्तियाँ) जैसे तुलनीय फ्रेमवर्क्स की तुलना में काफी छोटा है।
- Molt रैप अपस्ट्रीम घटकों को फोर्क किए बिना प्लेसमेंट के लिए Ray, रोलआउट के लिए vLLM और प्रशिक्षण के लिए NVIDIA AutoModel with FSDP2 का संयोजन करता है।
- एजेंटों को स्टैंडर्ड पायथन मॉड्यूल के रूप में Gymnasium-अलाइन Env या लूपबैक सर्वर के माध्यम से स्टॉक OpenAI/Anthropic SDKs का उपयोग करके लागू किया गया है।
- फ्रेमवर्क तीन सत्यता अचल नियमों को लागू करता है: टोकन पहचान, नीति-संस्करण अर्थशास्त्र और फॉरवर्ड संगतता, जिसमें मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल्स के लिए रोलआउट राउटिंग रीप्ले शामिल है।
- यह घने 4B मॉडलों से 700B MoE मॉडलों तक स्केलिंग का समर्थन करता है और H100/H200 हार्डवेयर पर तैनाती के लिए Slurm स्क्रिप्ट्स और प्रीबिल्ट कंटेनर्स के साथ आता है।
Molt शोधकर्ताओं को पूरे कोडबेस को अपने दिमाग में रखने की अनुमति देने वाली शोध बुनियादी ढांचा प्रदान करने का लक्ष्य रखता है, जिससे एस्टीमेटर और पाइपलाइन चरणों में आसान संशोधन सुविधाजनक होता है।