Z.ai a publié GLM-5.3, une expérience contrôlée démontrant que l'extension du post-entraînement apporte des gains significatifs dans le raisonnement à long terme sans modifier le modèle de base ni le nombre de paramètres.

La version conserve la même architecture et les paramètres totaux/activés que GLM-5.2, mais ajoute un mois d'extension sur des environnements à horizon long et l'apprentissage par renforcement. Les auteurs soutiennent que la profondeur effective et le post-entraînement sont désormais plus critiques que le nombre de paramètres pour des capacités comme le maintien de chaînes d'inférence complexes. Les lois d'échelle ont évolué de l'optimisation du calcul d'entraînement vers l'équilibre entre les données, le calcul et les coûts d'inférence, avec un nombre optimal de tokens par paramètre variant selon la tâche.

Cette approche permet à Z.ai d'améliorer des capacités spécifiques sans augmenter la taille du modèle, réservant l'extension du modèle de base aux itérations futures.