Nemotron Labs报告称,经过微调的Nemotron模型在2026年国际信息学奥林匹克竞赛(IOI)和2026年国际数学奥林匹克竞赛(IMO)中均达到了金牌水平的表现。团队利用监督微调、强化学习和反馈驱动推理来适配Nemotron基础模型以应对这些特定领域。

  • Nemotron-3-Nano-CC在IOI 2025中使用GenCorrect策略获得468分,超过了438.3的金牌阈值。
  • Nemotron-3-Ultra-CC在IOI 2026中经过单轮SFT后得分535.4/600。
  • IMO系统使用自然语言证明且无需外部工具,获得30/42分,超过了官方金牌阈值。
  • 训练过程涉及整理领域特定数据,包括22,000道编程问题和超过414,000个证明示例。

结果表明,将能力强大的专家模型与透明的推理工作流相结合,可以使开源权重模型在人类竞争的前沿解决问题。