A NVIDIA desenvolveu pipelines de pós-treinamento para seus modelos de linguagem Nemotron-3-Nano-CC e Nemotron-3-Ultra-CC para se destacarem na programação competitiva. Ao combinar a curadoria de problemas em larga escala, rastros de raciocínio sintéticos, ajuste fino supervisionado e aprendizado por reforço, a equipe criou sistemas especializados capazes de raciocínio algorítmico de alto nível.

O modelo Nano-CC (30B-A3B) foi treinado com SFT e RL, enquanto o modelo Ultra-CC (550B-A55B) usou apenas SFT. Uma estratégia orientada por feedback chamada GenCorrect foi introduzida para refinar iterativamente as soluções durante os testes. No IOI 2025, o Nano-CC marcou 468 pontos usando GenCorrect, excedendo o limite de ouro de 438,3, enquanto o Ultra-CC atingiu 502.

Um sistema Ultra-CC específico para a competição avaliado prospectivamente durante o IOI 2026 marcou 535,4 de 600 sob restrições padrão. Este resultado excede tanto o limite de ouro de 361,12 quanto a pontuação máxima humana de 498,27, marcando a primeira vez que um sistema de IA superou a pontuação do participante humano mais bem colocado em um conjunto de problemas do IOI.