Los investigadores han desarrollado una canalización post-entrenamiento para modelos de lenguaje grandes que les permite lograr un rendimiento de medalla de oro en programación competitiva. Al combinar el ajuste fino supervisado, el aprendizaje por refuerzo y una nueva estrategia impulsada por retroalimentación llamada GenCorrect, el sistema supera a los mejores concursantes humanos en el conjunto de problemas de la IOI 2026.

  • Nemotron-3-Nano-CC (30B-A3B) fue entrenado con SFT y RL, mientras que Nemotron-3-Ultra-CC (550B-A55B) utilizó solo SFT.
  • La estrategia GenCorrect genera, evalúa y refina iterativamente soluciones para mejorar el rendimiento.
  • En la IOI 2025, Nano-CC obtuvo 468 puntos con GenCorrect, superando el umbral de oro de 438.3.
  • En la IOI 2026, Ultra-CC obtuvo 535.4 de 600 bajo restricciones estándar, superando la puntuación más alta de un humano de 498.27.

Esto marca la primera vez que un sistema de IA supera en puntuación al concursante humano con mayor puntaje en un conjunto de problemas de la IOI, demostrando avances significativos en capacidades de razonamiento y codificación.