Des chercheurs ont développé un pipeline post-entraînement pour les grands modèles de langage qui leur permet d'atteindre des performances médaille d'or en programmation compétitive. En combinant le réglage fin supervisé, l'apprentissage par renforcement et une nouvelle stratégie pilotée par les feedbacks appelée GenCorrect, le système surpasse les meilleurs participants humains sur l'ensemble de problèmes de l'OII 2026.
- Nemotron-3-Nano-CC (30B-A3B) a été entraîné avec SFT et RL, tandis que Nemotron-3-Ultra-CC (550B-A55B) n'a utilisé que le SFT.
- La stratégie GenCorrect génère, évalue et affine itérativement les solutions pour améliorer les performances.
- À l'OII 2025, Nano-CC a marqué 468 avec GenCorrect, dépassant le seuil d'or de 438,3.
- À l'OII 2026, Ultra-CC a obtenu 535,4 sur 600 dans des conditions standard, surpassant le score du meilleur humain qui était de 498,27.
Cela marque la première fois qu'un système d'IA dépasse le score du meilleur participant humain sur un ensemble de problèmes de l'OII, démontrant des avancées significatives en raisonnement et en capacités de codage.