arxiv
arXiv cs.AI
·
2 दिन पहले
·
18 बार देखा गया
CodeMidas स्रोत कोड का उपयोग करके एजेंटिक कोडिंग RL पर्यावरणों को स्केल करता है
शोधकर्ताओं ने CodeMidas पेश किया, जो एक एजेंटिक पाइपलाइन है जो ओपन-सोर्स कोडबेसेस में कार्यान्वित फ़ंक्शनलिटी से पुनर्बल सीखने (reinforcement learning) पर्यावरण बनाती है, स्रोत कोड को एकमात्र इनपुट के रूप में उपयोग करके। विधि एजेंटिक कंप्यूट को फ़ंक्शनलिटी का अन्वेषण करने, निष्पादन-आधारित परीक्षण बनाने और बार-बार रोलआउट के माध्यम से कार्यों की सत्यापन करने के लिए आवंटित करती है, जिसके परिणामस्वरूप 23 प्रोग्रामिंग भाषाओं में 5,545 प्रशिक्षण कार्यों का एक डेटासेट बनता है। इन कार्यों पर GRPO के साथ MiMo-V2.5 को प्रशिक्षित करने से DeepSWE (+11.7%), ProgramBench (+17%) और Terminal-Bench v2.1 (+8.5%) सहित पांच विविध बेनचमार्क्स पर प्रदर्शन में सुधार होता है। ट्रैजेक्टरी विश्लेषण संकेत देता है कि RL-प्रशिक्षित एजेंट ने बेहतर व्यवहार प्रदर्शित किए, जैसे कोडबेस का अधिक अन्वेषण और अधिक विविध स्वयं सत्यापन। ये परिणाम स्रोत कोड को स्केलेबल आधार के रूप में स्थापित करते हैं जो विविध सॉफ्टवेयर कार्यों में कोडिंग एजेंट्स को बेहतर बनाने वाले RL पर्यावरण बनाने के लिए उपयोगी है।