연구자들은 오픈소스 코드베이스에 구현된 기능을 사용하여 소스 코드를 유일한 입력으로 강화학습 환경을 구축하는 에이전트 파이프라인인 CodeMidas를 소개했습니다. 이 방법은 기능 탐색, 실행 기반 테스트 구축, 반복 롤아웃을 통한 작업 검증을 위해 에이전트 컴퓨팅을 할당하며, 그 결과 23개 프로그래밍 언어에 걸쳐 5,545개의 학습 작업 데이터셋이 생성됩니다. GRPO를 사용하여 이러한 작업에서 MiMo-V2.5를 훈련하면 DeepSWE (+11.7%), ProgramBench (+17%), Terminal-Bench v2.1 (+8.5%) 등 다양한 벤치마크에서 성능이 향상됩니다. 궤적 분석에 따르면 RL로 훈련된 에이전트는 코드베이스 탐색 증가 및 더 다양한 자기 검증과 같은 더 나은 행동을 보이는 것으로 나타났습니다. 이러한 결과는 소스 코드가 다양한 소프트웨어 작업에서 코딩 에이전트를 개선하는 RL 환경을 구축하기 위한 확장 가능한 기반임을 입증합니다.