Z.ai merilis GLM-5.3, sebuah eksperimen terkontrol yang menunjukkan bahwa penskalaan pasca-pelatihan menghasilkan peningkatan signifikan dalam penalaran jangka panjang tanpa mengubah model dasar atau jumlah parameter.
Rilis ini mempertahankan arsitektur dan total/parameter aktif yang sama dengan GLM-5.2, tetapi menambahkan satu bulan penskalaan pada lingkungan horizon panjang dan pembelajaran penguatan. Para penulis berargumen bahwa kedalaman efektif dan pasca-pelatihan kini lebih kritis daripada jumlah parameter untuk kemampuan seperti membawa rantai inferensi kompleks. Hukum penskalaan telah bergeser dari mengoptimalkan komputasi pelatihan ke menyeimbangkan data, komputasi, dan biaya inferensi, dengan token optimal per parameter yang bervariasi tergantung pada tugas.
Pendekatan ini memungkinkan Z.ai meningkatkan kemampuan tertentu tanpa meningkatkan ukuran model, menyimpan penskalaan model dasar untuk iterasi mendatang.