A Z.ai lançou o GLM-5.3, um experimento controlado que demonstra que escalar o pós-treinamento gera ganhos significativos no raciocínio de longo prazo sem alterar o modelo base ou a contagem de parâmetros.

O lançamento mantém a mesma arquitetura e os parâmetros totais/ativados do GLM-5.2, mas adiciona um mês de escalonamento em ambientes de horizonte longo e aprendizado por reforço. Os autores argumentam que a profundidade efetiva e o pós-treinamento agora são mais críticos do que a contagem de parâmetros para capacidades como manter cadeias complexas de inferência. As leis de escalonamento mudaram de otimizar o compute de treinamento para equilibrar dados, compute e custos de inferência, com tokens ótimos por parâmetro variando conforme a tarefa.

Essa abordagem permite que a Z.ai melhore capacidades específicas sem aumentar o tamanho do modelo, reservando o escalonamento do modelo base para futuras iterações.