Pesquisadores desenvolveram um pipeline de pós-treinamento para modelos de linguagem grandes que permite alcançar desempenho de medalha de ouro em programação competitiva. Ao combinar ajuste fino supervisionado, aprendizado por reforço e uma nova estratégia orientada por feedback chamada GenCorrect, o sistema supera os melhores participantes humanos no conjunto de problemas do IOI 2026.

  • Nemotron-3-Nano-CC (30B-A3B) foi treinado com SFT e RL, enquanto Nemotron-3-Ultra-CC (550B-A55B) usou apenas SFT.
  • A estratégia GenCorrect gera, avalia e refere soluções de forma iterativa para melhorar o desempenho.
  • No IOI 2025, Nano-CC marcou 468 com GenCorrect, excedendo o limite de ouro de 438,3.
  • No IOI 2026, Ultra-CC marcou 535,4 de 600 sob restrições padrão, superando a pontuação máxima humana de 498,27.

Este é o primeiro momento em que um sistema de IA supera a pontuação do participante humano mais bem-sucedido em um conjunto de problemas do IOI, demonstrando avanços significativos nas capacidades de raciocínio e programação.