Los investigadores presentan CodeMidas, una canalización agéntica que construye entornos de aprendizaje por refuerzo a partir de la funcionalidad implementada en repositorios de código abierto, utilizando el código fuente como única entrada. El método asigna cómputo agéntico para explorar la funcionalidad, construir pruebas basadas en la ejecución y validar tareas mediante repeticiones repetidas, lo que resulta en un conjunto de datos de 5.545 tareas de entrenamiento en 23 lenguajes de programación. Entrenar MiMo-V2.5 en estas tareas con GRPO mejora el rendimiento en cinco benchmarks diversos, incluyendo DeepSWE (+11,7%), ProgramBench (+17%) y Terminal-Bench v2.1 (+8,5%). El análisis de trayectorias indica que el agente entrenado con RL exhibe mejores comportamientos, como una mayor exploración del repositorio de código y una autoverificación más diversa. Estos resultados establecen el código fuente como una base escalable para construir entornos de RL que mejoran a los agentes de programación en diversas tareas de software.
CodeMidas escala entornos de aprendizaje por refuerzo para programación agéntica utilizando código fuente
Los operadores post-hoc no logran mejorar la precisión en modelos pequeños de código
Un estudio de medición encuentra que 26 operadores semánticos post-hoc no mejoran la precisión en datos no vistos frente a Best-of-N en modelos pequeños de código congelados. Aunque dos operadores —la recuperación por capa de expresión y la parada temprana de consenso adaptativo— ofrecen beneficios en eficiencia computacional o recuperación de programas, ninguno supera a BoN en precisión. Los resultados destacan limitaciones sistémicas en la detección de errores y la cobertura, lo que sugiere que los arneses de modelos y la cobertura de errores deben mejorarse antes de considerar el razonamiento post-hoc.
Vista previa de Atria Dawn: modelo de lenguaje agénico fundamental para la investigación científica
Atria Dawn Preview es un modelo de lenguaje agénico fundamental diseñado para flujos de trabajo de investigación científica e ingeniería, entrenado mediante una Pipeline de Experiencia Verificable que conecta interacciones mediadas por herramientas con entornos ejecutables. En 16 benchmarks que abarcan investigación del mundo real, ingeniería y trabajo digital, el modelo es competitivo frente a agentes de vanguardia y alcanza la puntuación más alta reportada en cinco de ellos.
Los modelos Nemotron-3 de NVIDIA logran medalla de oro y puntuaciones por encima del nivel humano en la IOI 2026
Los investigadores han desarrollado una canalización post-entrenamiento para modelos de lenguaje grandes que les permite lograr un rendimiento de medalla de oro en programación competitiva. Al combinar el ajuste fino supervisado, el aprendizaje por refuerzo y una nueva estrategia impulsada por retroalimentación llamada GenCorrect, el sistema supera a los mejores concursantes humanos en el conjunto de problemas de la IOI 2026.
Los modelos NVIDIA Nemotron-3 logran rendimiento de medalla de oro en competiciones de programación IOI
NVIDIA ha desarrollado pipelines de post-entrenamiento para sus modelos de lenguaje Nemotron-3-Nano-CC y Nemotron-3-Ultra-CC con el fin de destacar en programación competitiva. Al combinar la curación a gran escala de problemas, trazas de razonamiento sintético, ajuste fino supervisado (SFT) y aprendizaje por refuerzo, el equipo creó sistemas especializados capaces de realizar razonamiento algorítmico de alto nivel.
Los modelos Nemotron-3 de NVIDIA logran rendimiento de medalla de oro en competencias de programación de la IOI
NVIDIA ha desarrollado una canalización de postentrenamiento para sus modelos de lenguaje Nemotron-3, permitiendo que alcancen un rendimiento de nivel de medalla de oro en la Olimpiada Internacional de Informática (IOI). El enfoque combina la curación a gran escala de problemas, trazos de razonamiento sintéticos, ajuste fino supervisado y aprendizaje por refuerzo.