TRL v1.14 ने AsyncGRPOTrainer में LoRA समर्थन पेश किया, जिससे यह एक Low-Rank Adaptation एडेप्टर को प्रशिक्षित कर सकता है और केवल उस छोटे फ़ाइल को vLLM इनफ़रेंस वर्करों पर समन्वयित कर सकता है। यह आर्किटेक्चर एक साझा Storage Bucket को फ़ाइल सिस्टम ब्रिज के रूप में उपयोग करके अलग-अलग मशीनों पर प्रशिक्षण और जनरेटिंग जॉब्स को अलग करता है, जिससे नोड्स के बीच NCCL या सीधे नेटवर्क संचार की आवश्यकता समाप्त हो जाती है।
- एक rank-1 एडेप्टर केवल कुछ मेगाबाइट का होता है, जो इसे NCCL के बजाय माउंटेड Storage Bucket के माध्यम से यात्रा करने में सक्षम बनाता है।
- ट्रेनर और vLLM रिप्लिका अलग-अलग मशीनों पर अलग Hugging Face Jobs के रूप में चलते हैं।
- एक प्रॉक्सी सर्वर प्रमाणीकरण हेडर्स जोड़ता है और एडेप्टर अपडेट्स को ब्रॉडकास्ट करते हुए प्रासंगिक KV प्रीफ़िक्स रखने वाले रिप्लिका तक रोलआउट्स को रूट करता है।
- पांच रनों ने 500 स्टेप्स के लिए प्रशिक्षण समय को 3 घंटे 27 मिनट से घटाकर 53 मिनट कर दिया।
यह सेटअप AsyncGRPOTrainer को उन वितरित वातावरणों में प्रभावी ढंग से संचालित करने की अनुमति देता है जहाँ नोड्स एक स्थानीय डिस्क साझा नहीं कर सकते या NCCL ग्रूप नहीं बना सकते, जिससे रिइन्फोर्समेंट लर्निंग वर्कफ़्लो में महत्वपूर्ण गति बढ़ती है।