ExecCritic एक ऐसा फ्रेमवर्क पेश करता है जो स्रोत-कोड मरम्मत से परीक्षण निर्माण को अलग करता है ताकि कोडिंग एजेंट्स में गलत आत्मविश्वास को रोका जा सके। सिस्टम एक Test एजेंट और एक Repair एजेंट का उपयोग करता है, दोनों Qwen-3.5-35B-A3B द्वारा समर्थित हैं, जिन्हें प्रबलन सीखने (reinforcement learning) का उपयोग कर अलग से प्रशिक्षित किया गया है।
- Test एजेंट व्यवहारिक रूप से वैध परीक्षण उत्पन्न करना सीखता है जो सही पatches को गलत ones से अलग कर सकता है।
- Repair एजेंट इन परीक्षणों से निष्पादन प्रतिक्रिया का उपयोग कर स्रोत कोड को संशोधित करता है, परीक्षण समूह को बदले बिना।
- SWE-bench Verified पर, post-trained Qwen एजेंट्स ने 72.6% सफलता दर हासिल की, जो no-test बेलाइन से 11.4 अंक का लाभ है।
- परीक्षण गुणवत्ता महत्वपूर्ण है; base मॉडल के परीक्षणों ने प्रदर्शन को कम कर दिया, जबकि GPT-5.6-sol परीक्षणों ने इसे 65.3% तक बढ़ा दिया।
यह दृष्टिकोण कोडिंग एजेंट्स को विश्वसनीय निष्पादन प्रतिक्रिया के माध्यम से रिपॉजिटरी मरम्मत में सुधार करने की अनुमति देता है, जिसके लिए मूल्यांकन के दौरान मजबूत मॉडल या Oracle प्रतिक्रिया की आवश्यकता नहीं होती।