أصدرت Z.ai نموذج GLM-5.3، وهو تجربة خاضعة للرقابة توضح أن توسيع التدريب اللاحق يحقق مكاسب كبيرة في الاستدلال طويل المدى دون تغيير النموذج الأساسي أو عدد المعاملات.
يحافظ الإصدار على نفس البنية وعدد المعاملات الكلية/المفعلة مثل GLM-5.2، لكنه يضيف شهرًا من التوسيع في بيئات الأفق الطويل والتعلم بالتعزيز. يجادل المؤلفون بأن العمق الفعال والتدريب اللاحق أصبحا الآن أكثر أهمية من عدد المعاملات للقدرة على التعامل مع سلاسل استنتاج معقدة. لقد تحولت قوانين التوسع من تحسين الحوسبة التدريبية إلى موازنة البيانات والحوسبة وتكاليف الاستنتاج، حيث يختلف العدد الأمثل للرموز لكل معامل حسب المهمة.
يتيح هذا النهج لـ Z.ai تحسين قدرات محددة دون زيادة حجم النموذج، مع الاحتفاظ بتوسيع النموذج الأساسي للتكرارات المستقبلية.