ExecCritic引入了一种框架,将测试构建与源代码修复分离开来,以防止编码智能体产生虚假的信心。该系统采用一个Test智能体和一个Repair智能体,两者均由Qwen-3.5-35B-A3B提供支持,并分别使用强化学习进行训练。

  • Test智能体学习生成行为上有效的测试,以区分正确的补丁与错误的补丁。
  • Repair智能体利用来自这些测试的执行反馈来修订源代码,而不改变测试套件。
  • 在SWE-bench Verified上,经过后训练的Qwen智能体取得了72.6%的成功率,比无测试基线提升了11.4个百分点。
  • 测试质量至关重要;基础模型的测试降低了性能,而GPT-5.6-sol的测试将其提升至65.3%。

这种方法使编码智能体能够通过可靠的执行反馈改进仓库修复工作,而在评估过程中无需更强的模型或Oracle反馈。