Les modèles Nemotron-3 de NVIDIA atteignent des scores médaille d'or et supérieurs aux meilleurs humains à l'OII 2026
Des chercheurs ont développé un pipeline post-entraînement pour les grands modèles de langage qui leur permet d'atteindre des performances médaille d'or en programmation compétitive. En combinant le réglage fin supervisé, l'apprentissage par renforcement et une nouvelle stratégie pilotée par les feedbacks appelée GenCorrect, le système surpasse les meilleurs participants humains sur l'ensemble de problèmes de l'OII 2026.