ExecCritic представляет собой фреймворк, который разделяет конструирование тестов и исправление исходного кода, чтобы предотвратить ложное доверие к кодогенерирующим агентам. Система использует Test agent и Repair agent, оба из которых поддерживаются моделью Qwen-3.5-35B-A3B и обучаются отдельно с помощью обучения с подкреплением.
- Test agent учится генерировать поведенчески корректные тесты, которые различают правильные патчи от неправильных.
- Repair agent использует обратную связь от выполнения этих тестов для пересмотра исходного кода без изменения набора тестов.
- На SWE-bench Verified постобученные агенты Qwen достигли уровня успеха 72.6%, что на 11.4 пункта выше базового уровня без тестов.
- Качество тестов критически важно; тесты базовой модели снизили производительность, тогда как тесты GPT-5.6-sol улучшили её до 65.3%.
Этот подход позволяет кодогенерирующим агентам улучшать исправления репозиториев посредством надёжной обратной связи от выполнения без необходимости использования более мощных моделей или Oracle feedback во время оценки.