Z.ai 发布了 GLM-5.3,这是一项受控实验,证明扩展后训练可以在不改变基础模型或参数数量的情况下,显著提升长程推理能力。
该版本保留了与 GLM-5.2 相同的架构和总/激活参数量,但增加了在长程环境和强化学习上的一个月扩展。 作者认为,对于执行复杂推理链等能力而言,有效深度和后训练现在比参数量更重要。 缩放定律已从优化训练计算转向平衡数据、计算和推理成本,每个参数的最优 token 数因任务而异。
这种方法使 Z.ai 能够在不增加模型规模的情况下提升特定能力,将基础模型的扩展留待未来迭代。