ExecCritic представляет собой фреймворк, который разделяет конструирование тестов и исправление исходного кода, чтобы предотвратить ложное доверие к кодогенерирующим агентам. Система использует Test agent и Repair agent, оба из которых поддерживаются моделью Qwen-3.5-35B-A3B и обучаются отдельно с помощью обучения с подкреплением.

  • Test agent учится генерировать поведенчески корректные тесты, которые различают правильные патчи от неправильных.
  • Repair agent использует обратную связь от выполнения этих тестов для пересмотра исходного кода без изменения набора тестов.
  • На SWE-bench Verified постобученные агенты Qwen достигли уровня успеха 72.6%, что на 11.4 пункта выше базового уровня без тестов.
  • Качество тестов критически важно; тесты базовой модели снизили производительность, тогда как тесты GPT-5.6-sol улучшили её до 65.3%.

Этот подход позволяет кодогенерирующим агентам улучшать исправления репозиториев посредством надёжной обратной связи от выполнения без необходимости использования более мощных моделей или Oracle feedback во время оценки.