يكشف مقارنة بين GLM-5.3 ومتغيره المكثف، GLM-5.3 Flash، على معيار DeepSWE أن التكثيف يحافظ على القدرة الأساسية في البرمجة مع تقليل تكاليف التنفيذ بشكل كبير. يحقق النموذج الكامل معدل نجاح 69.0% عند pass@1 بتكلفة $3.99 لكل مهمة، بينما يسجل المتغير Flash 63.4% بتكلفة $0.24 فقط، مما يمثل انخفاضاً في السعر بنسبة 17 مرة.

  • يتقلص فجوة الجودة من 5.6 نقطة عند pass@1 إلى 2.6 نقطة عند pass@4 (87.6% مقابل 85.0%)، مما يشير إلى أن الخسارة تتعلق بالموثوقية وليس القدرة.
  • يكلف GLM-5.3 Flash $0.24 لكل تنفيذ مقارنة بـ $3.99 للنموذج الكامل، مما ينتج عنه 264 مهمة محلولة مقابل كل $100 بدلاً من 17.
  • يفقد المتغير Flash القدرة على تحويل الجهد الإضافي إلى نجاح في المهام غير المستقرة، حيث تستغرق عمليات النجاح خطوات أكثر فقط في 46% من الحالات مقارنة بـ 61% للنموذج الكامل.
  • أعاد التكثيف تشكيل ملف الأداء، مكتسباً أرضية في التوازي وPython ونمذجة البيانات بينما تنازل عن JavaScript والأعمال الثقيلة بالاستعلامات.
  • تراجع ملحوظ هو تقليل الحذر، حيث كسر Flash اختبارات الأساس في 6.9% من عمليات التنفيذ مقارنة بـ 4.4% للنموذج الكامل.

تشغيل GLM-5.3 Flash أولاً وتصعيد الأمر إلى النموذج الكامل فقط عند الرفض يحل 80.9% من مهام DeepSWE بتكلفة $1.70 لكل منها، مما يوفر استراتيجية فعالة من حيث التكلفة للأحمال العاملة ضمن حدود النطاق الترددي.