शोधकर्ताओं ने CodeMidas पेश किया, जो एक एजेंटिक पाइपलाइन है जो ओपन-सोर्स कोडबेसेस में कार्यान्वित फ़ंक्शनलिटी से पुनर्बल सीखने (reinforcement learning) पर्यावरण बनाती है, स्रोत कोड को एकमात्र इनपुट के रूप में उपयोग करके। विधि एजेंटिक कंप्यूट को फ़ंक्शनलिटी का अन्वेषण करने, निष्पादन-आधारित परीक्षण बनाने और बार-बार रोलआउट के माध्यम से कार्यों की सत्यापन करने के लिए आवंटित करती है, जिसके परिणामस्वरूप 23 प्रोग्रामिंग भाषाओं में 5,545 प्रशिक्षण कार्यों का एक डेटासेट बनता है। इन कार्यों पर GRPO के साथ MiMo-V2.5 को प्रशिक्षित करने से DeepSWE (+11.7%), ProgramBench (+17%) और Terminal-Bench v2.1 (+8.5%) सहित पांच विविध बेनचमार्क्स पर प्रदर्शन में सुधार होता है। ट्रैजेक्टरी विश्लेषण संकेत देता है कि RL-प्रशिक्षित एजेंट ने बेहतर व्यवहार प्रदर्शित किए, जैसे कोडबेस का अधिक अन्वेषण और अधिक विविध स्वयं सत्यापन। ये परिणाम स्रोत कोड को स्केलेबल आधार के रूप में स्थापित करते हैं जो विविध सॉफ्टवेयर कार्यों में कोडिंग एजेंट्स को बेहतर बनाने वाले RL पर्यावरण बनाने के लिए उपयोगी है।
CodeMidas स्रोत कोड का उपयोग करके एजेंटिक कोडिंग RL पर्यावरणों को स्केल करता है
एट्रिया डॉन प्रीव्यू: वैज्ञानिक शोध के लिए फाउंडेशन एजेंटिक लैंग्वेज मॉडल
एट्रिया डॉन प्रीव्यू एक फाउंडेशन एजेंटिक लैंग्वेज मॉडल है जो वैज्ञानिक शोध और इंजीनियरिंग वर्कफ़्लो के लिए डिज़ाइन किया गया है, जिसका प्रशिक्षण टूल-मध्यस्थता वाले इंटरैक्शन को एक्सेकुटेबल एन्वायरनमेंट से जोड़ने वाली एक वेरिफिएबल एक्सपीरियंस पाइपलाइन के माध्यम से किया गया है। वास्तविक शोध, इंजीनियरिंग और डिजिटल कार्य को कवर करने वाले 16 बेंचमार्क में, यह मॉडल फ्रंटियर एजेंट्स के साथ प्रतिस्पर्धी है और उनमें से पांच पर उच्चतम रिपोर्ट किए गए स्कोर प्राप्त करता है।
NVIDIA Nemotron-3 मॉडल्स ने IOI 2026 में स्वर्ण पदक और शीर्ष मानव स्कोर हासिल किए
शोधकर्ताओं ने बड़े भाषा मॉडल्स के लिए एक पोस्ट-ट्रेनिंग पाइपलाइन विकसित की है जो उन्हें प्रतिस्पर्धी प्रोग्रामिंग में स्वर्ण पदक स्तर का प्रदर्शन करने में सक्षम बनाती है। सुपरवाइज्ड फाइन-ट्यूनिंग, रीइंफोर्समेंट लर्निंग और GenCorrect नामक एक नई फीडबैक-ड्रिवन रणनीति को जोड़कर, यह प्रणाली IOI 2026 समस्या सेट पर शीर्ष मानव प्रतिभागीओं से बेहतर प्रदर्शन करती है।
NVIDIA के Nemotron-3 मॉडल IOI कोडिंग प्रतियोगिताओं में स्वर्ण पदक स्तर की प्रदर्शन प्राप्त करते हैं
NVIDIA ने प्रतिस्पर्धी प्रोग्रामिंग में उत्कृष्टता हासिल करने के लिए अपने Nemotron-3-Nano-CC और Nemotron-3-Ultra-CC भाषा मॉडल के लिए पोस्ट-ट्रेनिंग पाइपलाइन विकसित की है। बड़े पैमाने पर समस्याओं का चयन, संश्लेषित तर्क ट्रेस, सुपरवाइज्ड फाइन-ट्यूनिंग और रीइंफोर्समेंट लर्निंग को जोड़कर, टीम ने उच्च स्तरीय एल्गोरिदमिक तर्क करने में सक्षम विशेष प्रणालियाँ बनाई हैं।
NVIDIA के Nemotron-3 मॉडल IOI कोडिंग प्रतियोगिताओं में स्वर्ण पदक स्तर की प्रदर्शनता हासिल करते हैं
NVIDIA ने अपने Nemotron-3 भाषा मॉडल के लिए एक पोस्ट-ट्रेनिंग पाइपलाइन विकसित की है, जिससे वे अंतर्राष्ट्रीय ओलंपियाड इन इन्फॉर्मेटिक्स (IOI) में स्वर्ण पदक स्तर की प्रदर्शनता हासिल कर सकें। इस दृष्टिकोण में बड़े-पैमाने पर समस्याओं का चयन, संश्लेषित तर्क ट्रेस, सुपरवाइज्ड फाइन-ट्यूनिंग और रीइंफोर्समेंट लर्निंग को जोड़ा गया है।
JIT-Agent ऑन-द-फ्लै हार्नेस विकास को सक्षम बनाता है ताकि एजेंटिक LLM प्रदर्शन में वृद्धि हो
लेखकों ने JIT-Agent प्रस्तुत किया है, जो एक हार्नेस इंटेलिजेंस मॉडल है जिसे मनमाने ऑफ-द-शेल्फ एजेंटिक LLMs के लिए कार्य-अनुकूलित एजेंट हार्नेस संश्लेषित करने के लिए प्रशिक्षित किया गया है। यह दृष्टिकोण एजेंट हार्नेस को एक संयोज्य कलाकार के रूप में परिभाषित करता है जो एक स्थिर चार-मॉड्यूलल प्रोटोकॉल द्वारा नियंत्रित होता है, जिससे सिस्टम हार्नेस को ऑन-द-फ्लै अनुकूलित और मरम्मत कर सकता है।