DeepSWE बेंचमार्क पर GLM-5.3 और इसके डिस्टिल्ड वेरिएंट, GLM-5.3 Flash की तुलना दर्शाती है कि डिस्टिलेशन कोर कोडिंग क्षमता को बनाए रखते हुए रोलआउट लागत को काफी कम करता है। पूर्ण मॉडल $3.99 प्रति कार्य पर 69.0% pass@1 दर प्राप्त करता है, जबकि Flash वेरिएंट केवल $0.24 पर 63.4% स्कोर करता है, जो 17x कीमती कमी का प्रतिनिधित्व करता है।
- गुणवत्ता अंतर pass@1 पर 5.6 बिंदुओं से pass@4 पर 2.6 बिंदुओं तक संकीर्ण हो जाता है (87.6% बनाम 85.0%), जो दर्शाता है कि हानि मुख्य रूप से विश्वसनीयता की है न कि क्षमता की।
- GLM-5.3 Flash का खर्च $0.24 प्रति रोलआउट है, जबकि पूर्ण मॉडल के लिए $3.99 है, जिससे $100 पर 264 हल किए गए कार्य मिलते हैं बनाम 17।
- Flash वेरिएंट flaky कार्यों पर अतिरिक्त प्रयास को सफलता में बदलने की क्षमता खो देता है, जहाँ पास करने वाले रन केवल 46% समय में अधिक चरण लेते हैं, जबकि पूर्ण मॉडल के लिए यह 61% है।
- डिस्टिलेशन ने प्रदर्शन प्रोफ़ाइल को पुनः आकार दिया, कंसर्रेंसी, Python और डेटा मॉडलिंग में जमीन हासिल करते हुए JavaScript और क्वेरी-भारी कार्य छोड़ दिए।
- एक उल्लेखनीय पश्चगमन सावधानी में कमी है, जिसमें Flash ने रोलआउट के 6.9% मामलों में बेलाइन टेस्ट तोड़े, जबकि पूर्ण मॉडल के लिए यह 4.4% था।
GLM-5.3 Flash को पहले चलाना और अस्वीकृति पर ही पूर्ण मॉडल पर स्केल करना DeepSWE कार्यों के 80.9% को $1.70 प्रति कार्य की लागत पर हल करता है, जो थ्रूपुट-बाउंड वर्कलोड के लिए एक लागत-प्रभावी रणनीति प्रदान करता है।