研究人员介绍了 CodeMidas,这是一种智能体管道,它使用源代码作为唯一输入,从开源代码库中实现的功能构建强化学习环境。 该方法分配智能体计算资源以探索功能、构建基于执行的测试,并通过重复 rollout 验证任务,最终生成涵盖 23 种编程语言的 5,545 个训练任务数据集。 在 GRPO 的帮助下在这些任务上训练 MiMo-V2.5,在五个多样化的基准测试中提升了性能,包括 DeepSWE (+11.7%)、ProgramBench (+17%) 和 Terminal-Bench v2.1 (+8.5%)。 轨迹分析表明,经过 RL 训练的代理表现出更好的行为,例如更深入的代码库探索和更多样化的自我验证。 这些结果确立了源代码作为构建强化学习环境的可扩展基础,能够提升编码智能体在多样化软件任务中的表现。