يكشف مقارنة بين GLM-5.3 وClaude Fable 5 في معيار DeepSWE أن كلا النموذجين يحققان دقة متقاربة جداً في المحاولة الأولى (69.0% مقابل 69.7%)، لكن GLM-5.3 أكثر فعالية من حيث التكلفة وأداءً أفضل في سيناريوهات المحاولات المتعددة.

  • تكلف GLM-5.3 دولاراً واحداً وثلاثة وتسعين سنتاً لكل جولة مقارنة بـ 21.63 دولاراً لـ Fable 5، مما يخلق فجوة سعرية تبلغ 5.4 مرات، وتنتج 17 حل مقابل كل 100 دولار مقابل 3 حلول لـ Fable.
  • في مقاييس المحاولات المتعددة، تتصدر GLM-5.3 بمعدل النجاح عند المحاولة الثانية (pass@2) بنسبة 81.1% (مقابل 77.1%) وعند المحاولة الرابعة (pass@4) بنسبة 87.6% (مقابل 84.1%)، مما يوضح سقف أداء أعلى.
  • النموذجان شبه بديلين لبعضهما البعض مع ارتباط لكل مهمة يبلغ 0.65، مما يعني أن تشغيل كلاهما يضيف تنوعاً قليلاً في التغطية.
  • تفوز GLM-5.3 في خمسة مجالات مهام بما في ذلك التزامن والمتانة، بينما تتصدر Fable 5 فقط في Rust (85% مقابل 70%) والأعمال الثقيلة بالتسلسل.

تختتم التحليل بأن GLM-5.3 يجب أن يكون النموذج الافتراضي لمعظم مهام هندسة البرمجيات بسبب تكلفته الأقل وتغطيته الأوسع، مع الاحتفاظ بـ Fable 5 كخيار مكلف للتصعيد فقط في أعمال Rust أو الحرجة بالنسبة للتسلسل.