يقدم ExecCritic إطار عمل يفصل بين بناء الاختبارات وإصلاح الشفرة المصدرية لمنع الثقة الزائفة في وكلاء البرمجة. يعتمد النظام على وكيل اختبار ووكيل إصلاح، وكلاهما مدعوم بـ Qwen-3.5-35B-A3B، وتم تدريبهما بشكل منفصل باستخدام تعزيز التعلم.

  • يتعلم وكيل الاختبار توليد اختبارات صالحة سلوكياً تميز بين التصحيحات الصحيحة والخاطئة.
  • يستخدم وكيل الإصلاح ملاحظات التنفيذ من هذه الاختارات لمراجعة الشفرة المصدرية دون تغيير مجموعة الاختبارات.
  • على SWE-bench Verified، حقق وكلاء Qwen المدربين بعد التدريب معدل نجاح بنسبة 72.6٪، وهو تحسن بمقدار 11.4 نقطة مقارنة بخط الأساس بدون اختبارات.
  • جودة الاختبار حاسمة؛ فقد أدت اختبارات النموذج الأساسي إلى تقليل الأداء، بينما حسنت اختبارات GPT-5.6-sol الأداء إلى 65.3٪.

يتيح هذا النهج لوكلاء البرمجة تحسين إصلاحات المستودعات من خلال ملاحظات التنفيذ الموثوقة دون الحاجة إلى نماذج أقوى أو ملاحظات Oracle أثناء التقييم.