研究人员为大型语言模型开发了一套后训练流水线,使其能够在竞技编程中达到金牌水平。通过结合监督微调、强化学习以及一种名为GenCorrect的新型反馈驱动策略,该系统在IOI 2026问题集上超越了顶级人类选手。

  • Nemotron-3-Nano-CC (30B-A3B) 使用SFT和RL进行训练,而Nemotron-3-Ultra-CC (550B-A55B) 仅使用SFT。
  • GenCorrect策略通过迭代生成、评估和优化解决方案来提升性能。
  • 在IOI 2025中,Nano-CC借助GenCorrect获得468分,超过金牌阈值438.3。
  • 在IOI 2026中,Ultra-CC在标准约束下获得535.4/600分,超越人类最高分498.27。

这是AI系统首次在IOI问题集上得分超过最高分的人类选手,展示了推理和编码能力的重大进展。