ExecCritic introduce un marco que separa la construcción de pruebas de la reparación del código fuente para evitar una confianza falsa en los agentes de codificación. El sistema emplea un agente de prueba y un agente de reparación, ambos respaldados por Qwen-3.5-35B-A3B, entrenados por separado mediante aprendizaje por refuerzo.

  • El agente de prueba aprende a generar pruebas válidas conductualmente que distinguen parches correctos de incorrectos.
  • El agente de reparación utiliza retroalimentación de ejecución de estas pruebas para revisar el código fuente sin alterar el conjunto de pruebas.
  • En SWE-bench Verified, los agentes Qwen post-entrenados lograron una tasa de éxito del 72.6%, un aumento de 11.4 puntos sobre la línea base sin pruebas.
  • La calidad de las pruebas es crítica; las pruebas del modelo base redujeron el rendimiento, mientras que las pruebas GPT-5.6-sol lo mejoraron al 65.3%.

Este enfoque permite a los agentes de codificación mejorar las reparaciones del repositorio mediante retroalimentación de ejecución confiable sin requerir modelos más potentes ni retroalimentación de Oracle durante la evaluación.