Les chercheurs présentent CodeMidas, un pipeline agentic qui construit des environnements d'apprentissage par renforcement à partir de la fonctionnalité implémentée dans des bases de code open-source, en utilisant le code source comme unique entrée. La méthode alloue du calcul agentic pour explorer la fonctionnalité, construire des tests ancrés sur l'exécution et valider les tâches via des rollouts répétés, aboutissant à un jeu de données de 5 545 tâches d'entraînement sur 23 langages de programmation. L'entraînement de MiMo-V2.5 sur ces tâches avec GRPO améliore les performances sur cinq benchmarks diversifiés, dont DeepSWE (+11,7%), ProgramBench (+17%) et Terminal-Bench v2.1 (+8,5%). L'analyse des trajectoires indique que l'agent entraîné par RL présente de meilleurs comportements, tels qu'une exploration accrue de la base de code et une auto-vérification plus diversifiée. Ces résultats établissent le code source comme une base évolutive pour construire des environnements RL qui améliorent les agents de codage dans diverses tâches logicielles.
CodeMidas met à l'échelle les environnements d'apprentissage par renforcement pour la programmation agentic en utilisant le code source
Aperçu d'Atria Dawn : un modèle de langage agentique fondamental pour la recherche scientifique
Atria Dawn Preview est un modèle de langage agentique fondamental conçu pour les workflows de recherche scientifique et d'ingénierie, entraîné via un pipeline d'expérience vérifiable qui relie les interactions médiées par des outils à des environnements exécutables. Sur 16 benchmarks couvrant la recherche en monde réel, l'ingénierie et le travail numérique, le modèle est compétitif avec les agents de pointe et obtient le score le plus élevé signalé sur cinq d'entre eux.
Les modèles Nemotron-3 de NVIDIA atteignent des scores médaille d'or et supérieurs aux meilleurs humains à l'OII 2026
Des chercheurs ont développé un pipeline post-entraînement pour les grands modèles de langage qui leur permet d'atteindre des performances médaille d'or en programmation compétitive. En combinant le réglage fin supervisé, l'apprentissage par renforcement et une nouvelle stratégie pilotée par les feedbacks appelée GenCorrect, le système surpasse les meilleurs participants humains sur l'ensemble de problèmes de l'OII 2026.
Les modèles NVIDIA Nemotron-3 atteignent des performances de médaille d'or aux compétitions de codage de l'IOI
NVIDIA a développé des pipelines de post-apprentissage pour ses modèles de langage Nemotron-3-Nano-CC et Nemotron-3-Ultra-CC afin d'exceller en programmation concurrentielle. En combinant la curation à grande échelle de problèmes, des traces de raisonnement synthétiques, un ajustement fin supervisé (SFT) et l'apprentissage par renforcement, l'équipe a créé des systèmes spécialisés capables de raisonnement algorithmique de haut niveau.
Les modèles Nemotron-3 de NVIDIA atteignent des performances de niveau médaille d'or aux compétitions de codage de l'Olympiade Internationale d'Informatique
NVIDIA a développé un pipeline post-entraînement pour ses modèles de langage Nemotron-3, leur permettant d'atteindre des performances de niveau médaille d'or à l'Olympiade Internationale d'Informatique (IOI). L'approche combine la curation de problèmes à grande échelle, des traces de raisonnement synthétiques, un ajustement fin supervisé et un apprentissage par renforcement.
JIT-Agent permet l'évolution en temps réel des harnais pour améliorer les performances des LLM agents
Les auteurs présentent JIT-Agent, un modèle d'intelligence de harnais entraîné à synthétiser des harnais d'agents adaptatifs aux tâches pour n'importe quel LLM agent standard. Cette approche formalise le harnais d'agent comme un artefact composable régi par un protocole fixe à quatre modules, permettant au système de personnaliser et de réparer les harnais en temps réel.