Peneliti memperkenalkan CodeMidas, sebuah pipeline agentic yang membangun lingkungan pembelajaran penguatan dari fungsionalitas yang diimplementasikan dalam basis kode open-source, dengan menggunakan kode sumber sebagai satu-satunya input. Metode ini mengalokasikan komputasi agentic untuk mengeksplorasi fungsionalitas, membangun tes berbasis eksekusi, dan memvalidasi tugas melalui rollouts berulang, menghasilkan dataset berisi 5.545 tugas pelatihan di 23 bahasa pemrograman. Pelatihan MiMo-V2.5 pada tugas-tugas ini dengan GRPO meningkatkan kinerja pada lima benchmark beragam, termasuk DeepSWE (+11,7%), ProgramBench (+17%), dan Terminal-Bench v2.1 (+8,5%). Analisis trajektori menunjukkan bahwa agen yang dilatih dengan RL menampilkan perilaku yang lebih baik seperti eksplorasi basis kode yang lebih besar dan verifikasi diri yang lebih beragam. Hasil-hasil ini menetapkan kode sumber sebagai fondasi yang dapat diskalakan untuk membangun lingkungan RL yang meningkatkan agen pemrograman di berbagai tugas perangkat lunak.