Исследователи разработали конвейер постобучения для больших языковых моделей, позволяющий им показывать результаты уровня золотой медали в соревновательном программировании. Комбинируя контролируемое тонкое обучение (SFT), обучение с подкреплением и новую стратегию, основанную на обратной связи, называемую GenCorrect, система превзошла лучших человеческих участников на наборе задач IOI 2026.

  • Nemotron-3-Nano-CC (30B-A3B) обучалась с использованием SFT и RL, тогда как Nemotron-3-Ultra-CC (550B-A55B) использовала только SFT.
  • Стратегия GenCorrect итеративно генерирует, оценивает и уточняет решения для повышения производительности.
  • На IOI 2025 Nano-CC набрал 468 баллов с использованием GenCorrect, превысив золотой порог в 438.3.
  • На IOI 2026 Ultra-CC набрал 535.4 из 600 при стандартных ограничениях, превзойдя лучший человеческий результат в 498.27.

Это первый случай, когда система искусственного интеллекта набрала больше баллов, чем самый высоко оцениваемый человек на наборе задач IOI, демонстрируя значительный прогресс в способностях к рассуждению и программированию.