arxiv
arXiv cs.AI
·
il y a 2 j
·
18 vues
CodeMidas met à l'échelle les environnements d'apprentissage par renforcement pour la programmation agentic en utilisant le code source
Les chercheurs présentent CodeMidas, un pipeline agentic qui construit des environnements d'apprentissage par renforcement à partir de la fonctionnalité implémentée dans des bases de code open-source, en utilisant le code source comme unique entrée. La méthode alloue du calcul agentic pour explorer la fonctionnalité, construire des tests ancrés sur l'exécution et valider les tâches via des rollouts répétés, aboutissant à un jeu de données de 5 545 tâches d'entraînement sur 23 langages de programmation. L'entraînement de MiMo-V2.5 sur ces tâches avec GRPO améliore les performances sur cinq benchmarks diversifiés, dont DeepSWE (+11,7%), ProgramBench (+17%) et Terminal-Bench v2.1 (+8,5%). L'analyse des trajectoires indique que l'agent entraîné par RL présente de meilleurs comportements, tels qu'une exploration accrue de la base de code et une auto-vérification plus diversifiée. Ces résultats établissent le code source comme une base évolutive pour construire des environnements RL qui améliorent les agents de codage dans diverses tâches logicielles.