NVIDIA a développé un pipeline post-entraînement pour ses modèles de langage Nemotron-3, leur permettant d'atteindre des performances de niveau médaille d'or à l'Olympiade Internationale d'Informatique (IOI). L'approche combine la curation de problèmes à grande échelle, des traces de raisonnement synthétiques, un ajustement fin supervisé et un apprentissage par renforcement.

  • Nemotron-3-Nano-CC (30B-A3B) a été entraîné avec un ajustement fin supervisé et un apprentissage par renforcement, tandis que Nemotron-3-Ultra-CC (550B-A55B) n'a utilisé que l'ajustement fin supervisé.
  • La stratégie GenCorrect génère, évalue et affine itérativement des solutions diverses pendant le temps de test.
  • Lors de l'IOI 2025, Nano-CC a marqué 468 points avec GenCorrect, dépassant le seuil d'or de 438,3, tandis qu'Ultra-CC a atteint 502.
  • Un système Ultra-CC spécifique à la compétition, évalué prospectivement sur les contraintes de l'IOI 2026, a obtenu 535,4 sur 600, surpassant le score humain maximal de 498,27.

Cela marque la première fois qu'un système d'IA dépasse le score du meilleur participant humain sur un ensemble de problèmes de l'IOI dans des conditions de compétition standard.