शोधकर्ताओं ने बड़े भाषा मॉडल्स के लिए एक पोस्ट-ट्रेनिंग पाइपलाइन विकसित की है जो उन्हें प्रतिस्पर्धी प्रोग्रामिंग में स्वर्ण पदक स्तर का प्रदर्शन करने में सक्षम बनाती है। सुपरवाइज्ड फाइन-ट्यूनिंग, रीइंफोर्समेंट लर्निंग और GenCorrect नामक एक नई फीडबैक-ड्रिवन रणनीति को जोड़कर, यह प्रणाली IOI 2026 समस्या सेट पर शीर्ष मानव प्रतिभागीओं से बेहतर प्रदर्शन करती है।

  • Nemotron-3-Nano-CC (30B-A3B) को SFT और RL के साथ ट्रेन किया गया, जबकि Nemotron-3-Ultra-CC (550B-A55B) ने केवल SFT का उपयोग किया।
  • GenCorrect रणनीति प्रदर्शन में सुधार करने के लिए समाधानों को पुनरावृत्त रूप से जनरेट, मूल्यांकन और परिष्कृत करती है।
  • IOI 2025 पर, Nano-CC ने GenCorrect के साथ 468 स्कोर किया, जो स्वर्ण सीमा रेखा 438.3 से अधिक था।
  • IOI 2026 में, Ultra-CC ने मानक प्रतिबंधों के तहत 600 में से 535.4 स्कोर किया, जिसने शीर्ष मानव स्कोर 498.27 को पार कर दिया।

यह पहली बार है जब एक AI प्रणाली ने IOI समस्या सेट पर सबसे अधिक स्कोर करने वाले मानव प्रतिभागी से बेहतर स्कोर हासिल किया है, जो तर्क और कोडिंग क्षमताओं में महत्वपूर्ण प्रगति का प्रदर्शन करता है।