DeepSWE बेंचमार्क पर GLM-5.3 और Claude Fable 5 की तुलना से पता चलता है कि जबकि दोनों मॉडल्स लगभग समान पहली-शॉट सटीकता प्राप्त करते हैं (69.0% बनाम 69.7%), GLM-5.3 काफी अधिक लागत-प्रभावी है और बहु-प्रयास परिदृश्यों में बेहतर प्रदर्शन करता है।
- GLM-5.3 का खर्च रोलआउट प्रति $3.99 है, जबकि Fable 5 का खर्च $21.63 है, जो 5.4x की मूल्य खाई पैदा करता है और $100 पर 17 समाधान देता है, जबकि Fable केवल 3 देता है।
- बहु-प्रयास मापदंडों में, GLM-5.3 pass@2 पर 81.1% (बनाम 77.1%) और pass@4 पर 87.6% (बनाम 84.1%) के साथ अग्रणी है, जो एक उच्च छत को दर्शाता है।
- मॉडल्स निकटवर्ती प्रतिस्थापन हैं, जिसमें प्रति-कार्य सहसंबंध 0.65 है, जिसका अर्थ है कि दोनों चलाने से कवर विविधता में बहुत अधिक वृद्धि नहीं होती।
- GLM-5.3 संवहन और टिकाऊता सहित पांच कार्य डोमेन में जीतता है, जबकि Fable 5 केवल Rust (85% बनाम 70%) और सीरियलाइजेशन-भारी कार्यों में अग्रणी है।
विश्लेषण से निष्कर्ष निकलता है कि कम लागत और व्यापक कवर के कारण GLM-5.3 अधिकांश सॉफ्टवेयर इंजीनियरिंग कार्यों के लिए डिफ़ॉल्ट मॉडल होना चाहिए, जबकि Fable 5 को विशेष रूप से Rust या सीरियलाइजेशन-निर्णायक कार्य के लिए एक महंगा बढ़ावा पथ के रूप में आरक्षित रखा जाना चाहिए।