Z.ai lanzó GLM-5.3, un experimento controlado que demuestra que escalar el postentrenamiento produce ganancias significativas en el razonamiento a largo plazo sin cambiar el modelo base ni la cantidad de parámetros.

El lanzamiento mantiene la misma arquitectura y los parámetros totales/activados que GLM-5.2, pero añade un mes de escalado en entornos de horizonte largo y aprendizaje por refuerzo. Los autores argumentan que la profundidad efectiva y el postentrenamiento son ahora más críticos que la cantidad de parámetros para capacidades como llevar cadenas complejas de inferencia. Las leyes de escalado han pasado de optimizar el cómputo de entrenamiento a equilibrar datos, cómputo y costos de inferencia, variando los tokens óptimos por parámetro según la tarea.

Este enfoque permite a Z.ai mejorar capacidades específicas sin aumentar el tamaño del modelo, reservando el escalado del modelo base para futuras iteraciones.