DeepSWE बेंचमार्क पर DeepSeek-V4 Flash 0731 और GPT-5.6 Luna की तुलना से पता चलता है कि जबकि GPT-5.6 Luna एक बेहतर इंजीनियर है, दोनों मॉडलों का उपयोग करने वाला कैस्केड रणनीति कम लागत में उच्च सटीकता प्रदान करती है।
- DeepSWE pass@1 पर GPT-5.6 Luna 67.2% के साथ गहराई से आगे है, जबकि DeepSeek का स्कोर 53.3% है, और हर समान प्रयास संख्या में अपनी बढ़त बनाए रखता है।
- DeepSeek-V4 Flash बोर्ड पर सबसे सस्ता मॉडल है, जो रोलआउट प्रति $0.10 पर आता है, जिससे $100 में 532 समाधान मिलते हैं, जबकि Luna केवल 110 देती है।
- DeepSeek को पहले चलाना और केवल विफलता पर Luna तक बढ़ाना 78.9% कार्यों को $0.385 प्रति कार्य की लागत पर हल करता है, जो Luna अकेले से सटीकता और लागत दोनों में बेहतर है।
- DeepSeek अधिक स्वच्छ रूप से विफल होता है, रिपॉजिटरी के मौजूदा टेस्ट सूइट को 9% विफलताओं में तोड़ देता है, जबकि Luna यह 15% में करती है।
कैस्केड दृष्टिकोण DeepSeek की कम लागत का लाभ उठाकर लगभग आधे कार्यों को हल करता है, जिससे फ्लैगशिप मॉडल कठिन समस्याओं पर ध्यान केंद्रित कर सकता है और एक संयुक्त परिणाम प्राप्त होता है जो किसी भी अकेले मॉडल से बेहतर प्रदर्शन करता है।