Los investigadores presentan ExecCritic, un marco que combina una estructura de verificar-revisar-corregir con aprendizaje por refuerzo específico por rol para potenciar agentes de codificación. El sistema separa la construcción de pruebas de la reparación del código fuente, utilizando un agente de Pruebas para generar pruebas nativas del repositorio y un agente de Reparación para revisar el código basándose en retroalimentación de ejecución.
- La arquitectura utiliza Qwen-3.5-35B-A3B como columna vertebral para ambos roles, entrenados por separado.
- El agente de Pruebas aprende a producir pruebas válidas desde el punto de vista conductual que distinguen parches correctos de incorrectos.
- El agente de Reparación aprende la resolución directa de tareas y la revisión guiada por retroalimentación.
- En SWE-bench Verified, las pruebas de un agente Qwen Pruebas post-entrenado elevan la tasa resuelta al 72.6%, una ganancia de 11.4 puntos sobre la línea base sin pruebas.
Los autores consideran esto importante porque la calidad de las pruebas determina si la retroalimentación de ejecución ayuda, y ExecCritic logra ganancias significativas sin requerir modelos más potentes ni retroalimentación Oracle en el momento de la evaluación.