يكشف التحليل المقارن بين GLM-5.3 و GPT-5.6 Sol على معيار DeepSWE أن استراتيجية التوجيه المتسلسل تتفوق على استخدام أي من النموذجين بشكل منفصل. ومن خلال تشغيل GLM-5.3 أولاً، ثم التصعيد إلى GPT-5.6 Sol فقط عند فشل الاختبارات، يحل النظام 85.9% من المهام بتكلفة 6.61 دولار لكل مهمة.

  • تكلف GLM-5.3 3.99 دولار لكل جولة تشغيل مقارنة بـ 8.37 دولار لـ Sol، مما يجعلها أرخص بنسبة 2.1 مرة، وتنتج 17 مهمة محلولة مقابل كل 100 دولار، بينما تنتج Sol 9 مهام فقط.
  • يتصدر GPT-5.6 Sol من حيث الدقة في المحاولة الواحدة (72.7% نجاح@1) والموثوقية (حل 61 مهمة بأربعة محاولات ناجحة)، بينما تتساوى GLM-5.3 مع Sol عند نجاح@2 وتتفوق عند نجاح@4 (87.6%).
  • تختلف النماذج بشكل كبير بمعامل ارتباط قدره 0.43 لكل مهمة، وتغطي معاً 106 من أصل 113 مهمة، مما يمكّن السلسلة المتتالية من أن تكون فعالة.
  • تظهر GLM-5.3 حالات فشل أنظف، حيث تُفسد الاختبارات الموجودة في 11% فقط من حالات الفشل مقارنة بـ 20% لـ Sol، مما يقلل الحاجة إلى تصفية الانحدار القوية.

يستفيد هذا النهج من GLM-5.3 كواجهة أمامية منخفضة التكلفة و Sol كتصعيد محكوم بفحص التحقق، محققاً تغطية أعلى من Sol وحده مع بقاء التكلفة أقل من جولة تشغيل Sol واحدة.