研究人员推出了ExecCritic,这是一个将测试-验证-修订框架与角色特定的强化学习相结合,以增强编码智能体的框架。该系统将测试构建与源代码修复分离,使用Test智能体生成仓库原生测试,并使用Repair智能体根据执行反馈修订代码。

  • 该架构使用Qwen-3.5-35B-A3B作为两个角色的骨干模型,并分别进行训练。
  • Test智能体学习生成在行为上有效的测试,以区分正确的补丁与错误的补丁。
  • Repair智能体学习直接的任务解决和基于反馈的修订。
  • 在SWE-bench Verified上,经过后训练的Qwen Test智能体生成的测试将解决率提升至72.6%,相较于无测试基线提高了11.4个百分点。

作者认为这很重要,因为测试质量决定了执行反馈是否有效,而ExecCritic在不要求更强模型或评估时Oracle反馈的情况下实现了显著的提升。