ExecCritic은 코딩 에이전트의 잘못된 자신감을 방지하기 위해 테스트 구성과 소스 코드 수리를 분리하는 프레임워크를 도입합니다. 이 시스템은 Qwen-3.5-35B-A3B로 구동되는 Test 에이전트와 Repair 에이전트를 사용하며, 두 에이전트는 각각 강화 학습을 통해 훈련됩니다.

  • Test 에이전트는 올바른 패치와 잘못된 패치를 구분하는 행동적으로 유효한 테스트를 생성하는 방법을 학습합니다.
  • Repair 에이전트는 이러한 테스트로부터의 실행 피드백을 사용하여 테스트 스위트는 변경하지 않고 소스 코드를 수정합니다.
  • SWE-bench Verified에서 사후 훈련된 Qwen 에이전트는 72.6%의 성공률을 달성하여 테스트 없는 기준선 대비 11.4점의 향상을 보였습니다.
  • 테스트 품질이 매우 중요합니다. 기본 모델의 테스트는 성능을 저하시킨 반면, GPT-5.6-sol 테스트는 성능을 65.3%로 향상시켰습니다.

이 접근 방식은 코딩 에이전트가 평가 중 더 강력한 모델이나 Oracle 피드백 없이도 신뢰할 수 있는 실행 피드백을 통해 저장소 수리를 개선할 수 있게 합니다.