ExecCritic introduit un cadre qui sépare la construction des tests de la réparation du code source afin d'éviter une confiance excessive dans les agents de codage. Le système emploie un agent Test et un agent Repair, tous deux alimentés par Qwen-3.5-35B-A3B, entraînés séparément à l'aide de l'apprentissage par renforcement.

  • L'agent Test apprend à générer des tests comportementalement valides qui distinguent les correctifs corrects des incorrects.
  • L'agent Repair utilise les retours d'exécution issus de ces tests pour réviser le code source sans modifier la suite de tests.
  • Sur SWE-bench Verified, les agents Qwen post-entraînement ont atteint un taux de réussite de 72,6 %, soit une amélioration de 11,4 points par rapport à la référence sans test.
  • La qualité des tests est cruciale ; les tests du modèle de base ont réduit les performances, tandis que les tests GPT-5.6-sol les ont améliorées à 65,3 %.

Cette approche permet aux agents de codage d'améliorer les réparations de dépôt grâce à des retours d'exécution fiables, sans nécessiter de modèles plus puissants ni de feedback Oracle lors de l'évaluation.