Исследователи представляют ExecCritic — фреймворк, сочетающий структуру test-verify-revise с ролевым обучением с подкреплением для повышения эффективности кодогенерирующих агентов. Система разделяет создание тестов и исправление исходного кода: Test-агент генерирует тесты, специфичные для репозитория, а Repair-агент корректирует код на основе обратной связи от выполнения.

  • Архитектура использует Qwen-3.5-35B-A3B в качестве основы для обеих ролей, обученных раздельно.
  • Test-агент учится создавать тесты, поведенчески корректные и способные отличать правильные патчи от неправильных.
  • Repair-агент учится напрямую решать задачи и выполнять исправления, направляемые обратной связью.
  • На SWE-bench Verified тесты от постобученного Test-агента Qwen повышают долю решённых задач до 72.6%, что на 11.4 пункта больше, чем базовый вариант без тестов.

Авторы считают это важным, поскольку качество тестов определяет, помогает ли обратная связь от выполнения, и ExecCritic достигает значительных улучшений без необходимости использования более мощных моделей или Oracle-обратной связи на этапе оценки.