माइक्रोसॉफ्ट रिसर्च एशिया ने "हार्नेस्ड एजेंटिक RL" प्रशिक्षण पैराडाइम को लागू करने वाला एक हल्का ढांचा, एजेंट लाइटनिंग v1.0 ओपन-सोर्स किया है। यह दृष्टिकोण पुनर्बल सीखने (reinforcement learning) को उत्पादन में तैनात किए गए उसी एजेंट हार्नेस का उपयोग करने की अनुमति देता है, जिससे प्रशिक्षण प्रणाली के भीतर एजेंट तर्क को फिर से लागू करने की आवश्यकता समाप्त हो जाती है।
- इस ढांचे में लगभग 3,500 कोड पंक्तियाँ शामिल हैं और इसमें एक API गेटवे, रोलआउट कंट्रोलर और अनुकूलित ट्रेनर शामिल हैं।
- यह व्यावसायिक सैंडबॉक्स निर्भरता के बिना स्व-प्रबंधित क्लस्टरों, क्लाउड इंफ्रास्ट्रक्चर या स्थानीय वातावरण पर एजेंट्स के लिए नेटिव Kubernetes निष्पादन का समर्थन करता है।
- Qwen3.5-9B का उपयोग करने वाले एक अंत-से-अंत कोडिंग एजेंट पाइपलाइन ने SWE-bench Verified पर 14.6 प्रतिशत बिंदु की वृद्धि हासिल की, केवल लगभग 6,000 प्रशिक्षण नमूनों के साथ Pass@1 को 41.8% से बढ़ाकर 56.4% कर दिया।
यह डिज़ाइन शोधकर्ताओं और डेवलपर्स को अपने मौजूदा तैनाती हार्नेस के साथ सीधे एजेंट्स को प्रशिक्षित करने की सुविधा देता है, यह सुनिश्चित करते हुए कि प्रशिक्षित मॉडल तैनात प्रणाली के समान ही व्यवहार करे, जबकि एक सरल और पुनरुत्पादक पाइपलाइन बनाए रखी जाती है।