DeepSWE बेंचमार्क पर GLM-5.3 और GPT-5.6 Sol की तुलनात्मक विश्लेषण से पता चलता है कि एक संवर्धित रूटिंग रणनीति किसी भी मॉडल को अकेले उपयोग करने से बेहतर प्रदर्शन करती है। GLM-5.3 को पहले चलाने और केवल तब GPT-5.6 Sol पर स्केलेट करने के जब टेस्ट विफल होते हैं, सिस्टम प्रति कार्य $6.61 में 85.9% कार्यों को हल करता है।

  • GLM-5.3 का लागत रोलआउट प्रति $3.99 है जबकि Sol का $8.37 है, जो इसे 2.1x सस्ता बनाता है और प्रति $100 पर 17 हल किए गए कार्यों को देता है जबकि Sol केवल 9 देता है।
  • GPT-5.6 Sol एकल-शॉट सटीकता (72.7% pass@1) और विश्वसनीयता (61 कार्य चार-चार में हल किए गए) में अग्रणी है, जबकि GLM-5.3 pass@2 पर बराबरी करता है और pass@4 में अग्रणी है (87.6%)।
  • मॉडल 0.43 प्रति-कार्य सहसंबंध के साथ महत्वपूर्ण रूप से भिन्न होते हैं, उनके बीच 113 कार्यों में से 106 को कवर करते हैं, जो प्रभावी संवर्धन को सक्षम बनाता है।
  • GLM-5.3 स्वच्छ विफलता मोड प्रदर्शित करता है, केवल 11% विफलताओं में मौजूदा टेस्ट तोड़ता है जबकि Sol 20% तोड़ता है, जिससे भारी रgression गेटिंग की आवश्यकता कम हो जाती है।

यह दृष्टिकोण GLM-5.3 को कम लागत वाले फ्रंट एंड के रूप में और Sol को सत्यापक-गेटेड स्केलेटेशन के रूप में उपयोग करता है, जो अकेले Sol से उच्च कवरेज प्राप्त करता है जबकि एकल Sol रोलआउट से सस्ता रहता है।