يكشف مقارنة بين DeepSeek-V4 Flash 0731 وGPT-5.6 Luna على معيار DeepSWE أن GPT-5.6 Luna هو المهندس الأقوى، إلا أن استراتيجية التسلسل التي تستخدم كلا النموذجين تحقق دقة أعلى بتكلفة أقل.
- يتفوق GPT-5.6 Luna بشكل حاسم في DeepSWE بـ pass@1 بنسبة 67.2% مقابل 53.3% لـ DeepSeek، مع الحفاظ على تفوقه عند كل عدد محاولات متساوٍ.
- يُعد DeepSeek-V4 Flash أرخص نموذج متاح بسعر 0.10 دولار لكل عملية تشغيل، حيث يقدم 532 حلًا مقابل كل 100 دولار مقارنة بـ 110 لـ Luna.
- تشغيل DeepSeek أولاً ثم التصعيد إلى Luna فقط عند الفشل يحل 78.9% من المهام بتكلفة 0.385 دولار لكل مهمة، متفوقًا على استخدام Luna وحدها في كل من الدقة والتكلفة.
- يفشل DeepSeek بشكل أنظف، حيث يعطل مجموعة الاختبار الحالية للمستودع في 9% من حالات الفشل مقابل 15% لـ Luna.
تستغل نهج التسلسل السعر المنخفض لـ DeepSeek لإنهاء نحو نصف المهام، مما يسمح للنموذج الرائد بالتركيز على المشكلات الأصعب لتحقيق نتيجة مجتمعة تتفوق على أداء أي نموذج مستخدم بمفرده.