शोधकर्ताओं ने ExecCritic पेश किया, एक फ्रेमवर्क जो टेस्ट-सत्यापित-संशोधन स्केफोल्ड को भूमिका-विशिष्ट पुनर्बल सीखने के साथ मिलाकर कोडिंग एजेंट्स को बेहतर बनाता है। सिस्टम परीक्षण निर्माण और स्रोत-कोड मरम्मत को अलग करता है, एक Test एजेंट का उपयोग रिपॉजिटरी-नेटिव परीक्षण उत्पन्न करने के लिए और एक Repair एजेंट का उपयोग निष्पादन फीडबैक के आधार पर कोड संशोधित करने के लिए।
- आर्किटेक्चर दोनों भूमिकाओं के लिए Qwen-3.5-35B-A3B को बैकबोन के रूप में उपयोग करता है, जिन्हें अलग-अलग प्रशिक्षित किया गया।
- Test एजेंट व्यवहारिक रूप से वैध परीक्षण उत्पन्न करना सीखता है जो सही पatches को गलत से अलग करता है।
- Repair एजेंट सीधे कार्य समाधान और फीडबैक-निर्देशित संशोधन सीखता है।
- SWE-bench Verified पर, एक post-trained Qwen Test एजेंट से प्राप्त परीक्षणों ने हल होने की दर को 72.6% तक बढ़ा दिया, जो no-test बेलाइन के सापेक्ष 11.4 अंक का लाभ है।
लेखकों का मानना है कि यह महत्वपूर्ण है क्योंकि परीक्षण की गुणवत्ता निर्धारित करती है कि क्या निष्पादन फीडबैक मदद करता है, और ExecCritic मूल्यांकन के समय मजबूत मॉडल या Oracle फीडबैक की आवश्यकता के बिना महत्वपूर्ण लाभ प्राप्त करता है।