NVIDIA a développé des pipelines de post-apprentissage pour ses modèles de langage Nemotron-3-Nano-CC et Nemotron-3-Ultra-CC afin d'exceller en programmation concurrentielle. En combinant la curation à grande échelle de problèmes, des traces de raisonnement synthétiques, un ajustement fin supervisé (SFT) et l'apprentissage par renforcement, l'équipe a créé des systèmes spécialisés capables de raisonnement algorithmique de haut niveau.
Le modèle Nano-CC (30B-A3B) a été entraîné avec à la fois le SFT et l'apprentissage par renforcement (RL), tandis que le modèle Ultra-CC (550B-A55B) n'a utilisé que le SFT. Une stratégie pilotée par les feedbacks appelée GenCorrect a été introduite pour affiner itérativement les solutions pendant les tests. À l'IOI 2025, Nano-CC a marqué 468 points en utilisant GenCorrect, dépassant le seuil d'or de 438,3, tandis qu'Ultra-CC a atteint 502.
Un système Ultra-CC spécifique à la compétition, évalué prospectivement lors de l'IOI 2026, a marqué 535,4 sur 600 dans des contraintes standard. Ce résultat dépasse à la fois le seuil d'or de 361,12 et le score humain maximal de 498,27, marquant la première fois qu'un système IA surpasse le score du concurrent humain le mieux classé sur un ensemble de problèmes de l'IOI.