NVIDIA ने अपने Nemotron-3 भाषा मॉडल के लिए एक पोस्ट-ट्रेनिंग पाइपलाइन विकसित की है, जिससे वे अंतर्राष्ट्रीय ओलंपियाड इन इन्फॉर्मेटिक्स (IOI) में स्वर्ण पदक स्तर की प्रदर्शनता हासिल कर सकें। इस दृष्टिकोण में बड़े-पैमाने पर समस्याओं का चयन, संश्लेषित तर्क ट्रेस, सुपरवाइज्ड फाइन-ट्यूनिंग और रीइंफोर्समेंट लर्निंग को जोड़ा गया है।
- Nemotron-3-Nano-CC (30B-A3B) को सुपरवाइज्ड फाइन-ट्यूनिंग और रीइंफोर्समेंट लर्निंग के साथ प्रशिक्षित किया गया, जबकि Nemotron-3-Ultra-CC (550B-A55B) में केवल सुपरवाइज्ड फाइन-ट्यूनिंग का उपयोग किया गया।
- GenCorrect रणनीति परीक्षण समय के दौरान विविध समाधानों को पुनरावृत्त रूप से उत्पन्न, मूल्यांकित और परिष्कृत करती है।
- IOI 2025 पर Nano-CC ने GenCorrect के साथ 468 अंक प्राप्त किए, जो स्वर्ण सीमा 438.3 से अधिक है, जबकि Ultra-CC ने 502 अंक हासिल किए।
- एक प्रतियोगिता-विशिष्ट Ultra-CC सिस्टम ने IOI 2026 की बाधाओं पर भविष्यवाणी के आधार पर मूल्यांकन किया और 600 में से 535.4 अंक प्राप्त किए, जो शीर्ष मानव स्कोर 498.27 को पार कर गया।
यह पहली बार है जब एक AI सिस्टम ने मानक प्रतियोगिता की स्थितियों के तहत IOI समस्या सेट पर सबसे अधिक अंक प्राप्त करने वाले मानव प्रतिभागी से अधिक स्कोर हासिल किया है।