ExecCriticは、コーディングエージェントにおける過信を防ぐため、テスト構築とソースコードリペアを分離するフレームワークを導入している。本システムは、Qwen-3.5-35B-A3BによってバックアップされたTestエージェントとRepairエージェントを採用し、それぞれ強化学習を用いて個別に訓練されている。

  • Testエージェントは、正しいパッチと間違ったパッチを区別する振る舞い上有効なテストを生成することを学習する。
  • Repairエージェントは、これらのテストからの実行フィードバックを用いて、テストスイートを変更せずにソースコードを更新する。
  • SWE-bench Verifiedにおいて、ポストトレーニング済みのQwenエージェントは72.6%の成功率を達成し、テストなしのベースラインと比較して11.4ポイントの向上となった。
  • テストの品質が重要であり、ベースモデルによるテストはパフォーマンスを低下させた一方、GPT-5.6-solによるテストはパフォーマンスを65.3%まで向上させた。

このアプローチにより、コーディングエージェントは評価時により強力なモデルやOracleフィードバックを必要とせずとも、信頼性の高い実行フィードバックを通じてリポジトリのリペアを改善できる。