Z.ai выпустила GLM-5.3, контролируемый эксперимент, демонстрирующий, что масштабирование постобучения дает значительные улучшения в рассуждениях на длинных горизонтах без изменения базовой модели или количества параметров.

Выпуск сохраняет ту же архитектуру и общее/активированное количество параметров, что и GLM-5.2, но добавляет месяц масштабирования в средах с длинным горизонтом и обучении с подкреплением. Авторы утверждают, что эффективная глубина и постобучение теперь важнее количества параметров для таких возможностей, как выполнение сложных цепочек вывода. Законы масштабирования сместились от оптимизации вычислений при обучении к балансу данных, вычислений и затрат на вывод, при этом оптимальное количество токенов на параметр варьируется в зависимости от задачи.

Этот подход позволяет Z.ai улучшать конкретные возможности без увеличения размера модели, оставляя масштабирование базовой модели для будущих версий.