O ExecCritic apresenta um framework que separa a construção de testes do reparo do código-fonte para evitar confiança falsa em agentes de codificação. O sistema emprega um agente Test e um agente Repair, ambos apoiados pelo Qwen-3.5-35B-A3B, treinados separadamente usando aprendizado por reforço.
- O agente Test aprende a gerar testes comportamentalmente válidos que distinguem patches corretos de incorretos.
- O agente Repair usa feedback de execução desses testes para revisar o código-fonte sem alterar o conjunto de testes.
- No SWE-bench Verified, agentes Qwen pós-treinados alcançaram uma taxa de sucesso de 72,6%, um ganho de 11,4 pontos em relação à linha de base sem teste.
- A qualidade do teste é crítica; os testes do modelo base reduziram o desempenho, enquanto os testes do GPT-5.6-sol melhoraram para 65,3%.
Essa abordagem permite que agentes de codificação melhorem os reparos de repositórios por meio de feedback de execução confiável, sem exigir modelos mais fortes ou feedback Oracle durante a avaliação.