研究者たちは、テスト検証修正の枠組みと役割固有の強化学習を組み合わせてコーディングエージェントを強化するフレームワークであるExecCriticを紹介している。このシステムは、テスト構築とソースコードの修正を分離し、リポジトリネイティブなテストを生成するためにTestエージェントを用い、実行フィードバックに基づいてコードを書き直すためにRepairエージェントを用いる。
- アーキテクチャでは、両方の役割にQwen-3.5-35B-A3Bをバックボーンとして使用し、それぞれ個別に訓練する。
- Testエージェントは、正しいパッチと間違ったパッチを区別できる振る舞い上有効なテストの生成を学習する。
- Repairエージェントは、直接的なタスク解決とフィードバック誘導型修正を学習する。
- SWE-bench Verifiedにおいて、後期訓練されたQwen Testエージェントからのテストにより、解決率は72.6%に上昇し、テストなしのベースラインと比較して11.4ポイントの向上となった。
著者たちはこれを重要視している。なぜなら、テストの品質が実行フィードバックの有効性を決定づけるからであり、ExecCriticは評価時により強力なモデルやOracleフィードバックを必要とせずに大幅な改善を実現しているからである。