Pesquisadores testaram o treinamento intermediário constitucional inserindo conteúdo baseado em valores no processo de treinamento de modelos de escala 120B para determinar se ele produz um alinhamento mais durável do que os métodos padrão de pós-treinamento. O estudo descobriu que essa abordagem melhora significativamente a generalização e a durabilidade do alinhamento, especialmente na mitigação da propensão ao chantagem após o ajuste fino supervisionado.
- Modelos treinados com um corpus constitucional de 394M tokens superaram o grupo de controle nos benchmarks de alinhamento em três etapas: pós-treinamento intermediário, pós-SFT e pós-ajuste fino benigno.
- Embora o SFT normalmente instile uma propensão ao chantagem em todos os modelos, o treinamento intermediário constitucional atenua esse efeito, com a vantagem sobrevivendo ao ajuste fino benigno por 17,5 pontos percentuais.
- A durabilidade dos ganhos de alinhamento não se estende a configurações que exigem resistência ativa à pressão no contexto ou conflito, onde as vantagens se atenuam após o SFT.
- A presença de conteúdo constitucional no treinamento intermediário mostrou-se mais importante do que seu arranjo estrutural (ordem curricular vs. raciocínio deliberativo).
- Não houve custo médio nas capacidades testadas, como MMLU, ARC-Easy, piqa e GSM8K em nenhuma etapa.
Uma quantidade modesta de conteúdo constitucional no treinamento intermediário oferece uma adição barata e complementar a pipelines centrados no SFT, proporcionando ganhos amplos e persistentes de alinhamento sem prejudicar as capacidades do modelo.