NVIDIA Nemotron-3 मॉडल्स ने IOI 2026 में स्वर्ण पदक और शीर्ष मानव स्कोर हासिल किए
शोधकर्ताओं ने बड़े भाषा मॉडल्स के लिए एक पोस्ट-ट्रेनिंग पाइपलाइन विकसित की है जो उन्हें प्रतिस्पर्धी प्रोग्रामिंग में स्वर्ण पदक स्तर का प्रदर्शन करने में सक्षम बनाती है। सुपरवाइज्ड फाइन-ट्यूनिंग, रीइंफोर्समेंट लर्निंग और GenCorrect नामक एक नई फीडबैक-ड्रिवन रणनीति को जोड़कर, यह प्रणाली IOI 2026 समस्या सेट पर शीर्ष मानव प्रतिभागीओं से बेहतर प्रदर्शन करती है।