Pesquisadores apresentam o CodeMidas, um pipeline agêntico que constrói ambientes de aprendizado por reforço a partir da funcionalidade implementada em repositórios de código aberto, utilizando o código-fonte como única entrada. O método aloca computação agêntica para explorar a funcionalidade, construir testes fundamentados na execução e validar tarefas por meio de repetidas rollouts, resultando em um conjunto de dados com 5.545 tarefas de treinamento em 23 linguagens de programação. Treinar o MiMo-V2.5 nessas tarefas com GRPO melhora o desempenho em cinco benchmarks diversos, incluindo DeepSWE (+11,7%), ProgramBench (+17%) e Terminal-Bench v2.1 (+8,5%). A análise de trajetórias indica que o agente treinado com RL exibe comportamentos melhores, como maior exploração da base de código e autoverificação mais diversa. Esses resultados estabelecem o código-fonte como uma base escalável para a construção de ambientes de RL que melhoram agentes de codificação em diversas tarefas de software.
CodeMidas escala ambientes de RL para codificação agêntica usando código-fonte
Prévia do Atria Dawn: modelo de linguagem agêntico fundamental para pesquisa científica
O Atria Dawn Preview é um modelo de linguagem agêntico fundamental projetado para fluxos de trabalho de pesquisa científica e engenharia, treinado por meio de um Pipeline de Experiência Verificável que conecta interações mediadas por ferramentas a ambientes executáveis. Em 16 benchmarks que abrangem pesquisa do mundo real, engenharia e trabalho digital, o modelo é competitivo em relação aos agentes de ponta e alcança a maior pontuação relatada em cinco deles.
Modelos Nemotron-3 da NVIDIA alcançam pontuação de ouro e recorde humano em IOI 2026
Pesquisadores desenvolveram um pipeline de pós-treinamento para modelos de linguagem grandes que permite alcançar desempenho de medalha de ouro em programação competitiva. Ao combinar ajuste fino supervisionado, aprendizado por reforço e uma nova estratégia orientada por feedback chamada GenCorrect, o sistema supera os melhores participantes humanos no conjunto de problemas do IOI 2026.
Modelos NVIDIA Nemotron-3 alcançam desempenho de medalha de ouro em competições de programação do IOI
A NVIDIA desenvolveu pipelines de pós-treinamento para seus modelos de linguagem Nemotron-3-Nano-CC e Nemotron-3-Ultra-CC para se destacarem na programação competitiva. Ao combinar a curadoria de problemas em larga escala, rastros de raciocínio sintéticos, ajuste fino supervisionado e aprendizado por reforço, a equipe criou sistemas especializados capazes de raciocínio algorítmico de alto nível.
Modelos Nemotron-3 da NVIDIA alcançam desempenho de medalha de ouro em competições de programação da IOI
A NVIDIA desenvolveu um pipeline de pós-treinamento para seus modelos de linguagem Nemotron-3, permitindo que eles alcancem desempenho de nível de medalha de ouro na Olimpíada Internacional de Informática (IOI). A abordagem combina curadoria em larga escala de problemas, rastros de raciocínio sintéticos, ajuste fino supervisionado e aprendizado por reforço.
JIT-Agent permite evolução dinâmica de harnesses para impulsionar o desempenho de LLMs agênticos
Os autores apresentam o JIT-Agent, um modelo de inteligência de harness treinado para sintetizar harnesses adaptativos a tarefas para LLMs agênticos genéricos disponíveis no mercado. Essa abordagem formaliza o agente como um artefato composável regido por um protocolo fixo de quatro módulos, permitindo que o sistema personalize e repare os harnesses em tempo real.