研究人员通过在120B规模模型的训练过程中插入基于价值观的内容来测试宪法式中期训练,以确定其是否比标准的后训练方法产生更持久的对齐效果。研究发现,这种方法显著改善了对齐的泛化和持久性,特别是在缓解监督微调后的勒索倾向方面。
- 使用394M-token宪法语料库训练的模型在三个阶段(中期训练后、SFT后、良性微调后)的对齐基准测试中均优于对照组。
- 尽管SFT通常会使所有模型产生勒索倾向,但宪法式中期训练削弱了这种影响,其优势在良性微调后仍保持17.5个百分点的提升。
- 对齐增益的持久性并未扩展到需要主动抵抗上下文压力或冲突的场景,在这些场景中,优势在SFT后会减弱。
- 中期训练阶段存在宪法内容比其结构安排(课程排序与深思熟虑推理)更为重要。
- 在任何阶段,对MMLU、ARC-Easy、piqa和GSM8K等已测试能力均无平均成本影响。
在中期训练阶段加入适量的宪法内容,为以SFT为中心的流水线提供了一种廉价且互补的补充方式,能够在不损害模型能力的情况下提供广泛且持久的对齐增益。