연구자들은 테스트-검증-수정 스캐폴드와 역할별 강화 학습을 결합하여 코딩 에이전트를 향상시키는 프레임워크인 ExecCritic을 소개했다. 이 시스템은 테스트 구축과 소스 코드 수리를 분리하며, Test 에이전트는 저장소 네이티브 테스트를 생성하고 Repair 에이전트는 실행 피드백을 기반으로 코드를 수정한다.

  • 아키텍처는 두 역할 모두에 Qwen-3.5-35B-A3B를 백본으로 사용하며, 별도로 훈련된다.
  • Test 에이전트는 올바른 패치와 잘못된 패치를 구분하는 행동적으로 유효한 테스트를 생성하는 방법을 학습한다.
  • Repair 에이전트는 직접적인 작업 해결과 피드백 기반 수정을 학습한다.
  • SWE-bench Verified에서 사후 훈련된 Qwen Test 에이전트의 테스트는 해결률을 72.6%로 높여, 테스트 없는 기준선 대비 11.4포인트의 향상을 기록했다.

저자들은 테스트 품질이 실행 피드백의 효과를 결정하기 때문에 이것이 중요하다고 간주하며, ExecCritic은 평가 시 더 강력한 모델이나 Oracle 피드백을 요구하지 않고도 상당한 성능 향상을 달성했다.