Les chercheurs présentent ExecCritic, un cadre qui combine un échafaudage de vérification-révision de tests avec un apprentissage par renforcement spécifique au rôle pour améliorer les agents de codage. Le système sépare la construction des tests de la réparation du code source, en utilisant un agent Test pour générer des tests natifs au dépôt et un agent Repair pour réviser le code sur la base des retours d'exécution.

  • L'architecture utilise Qwen-3.5-35B-A3B comme colonne vertébrale pour les deux rôles, entraînés séparément.
  • L'agent Test apprend à produire des tests comportementalement valides qui distinguent les correctifs corrects des incorrects.
  • L'agent Repair apprend la résolution directe de la tâche et la révision guidée par les retours.
  • Sur SWE-bench Verified, les tests d'un agent Test post-entraînement Qwen portent le taux de résolution à 72,6 %, soit une amélioration de 11,4 points par rapport à la ligne de base sans test.

Les auteurs considèrent cela comme important car la qualité des tests détermine si les retours d'exécution sont utiles, et ExecCritic obtient des gains significatifs sans nécessiter de modèles plus puissants ni de retours Oracle lors de l'évaluation.