Pesquisadores apresentam o ExecCritic, um framework que combina uma estrutura de testar-verificar-revisar com aprendizado por reforço específico por função para aprimorar agentes de codificação. O sistema separa a construção de testes do reparo do código-fonte, utilizando um agente Test para gerar testes nativos do repositório e um agente Repair para revisar o código com base no feedback de execução.
- A arquitetura usa Qwen-3.5-35B-A3B como backbone para ambas as funções, treinadas separadamente.
- O agente Test aprende a produzir testes comportamentalmente válidos que distinguem patches corretos de incorretos.
- O agente Repair aprende resolução direta de tarefas e revisão guiada por feedback.
- No SWE-bench Verified, os testes de um agente Qwen Test pós-treinado elevam a taxa de resolução para 72,6%, um ganho de 11,4 pontos em relação à linha de base sem teste.
Os autores consideram isso importante porque a qualidade dos testes determina se o feedback de execução ajuda, e o ExecCritic alcança ganhos significativos sem exigir modelos mais fortes ou feedback Oracle no momento da avaliação.