研究者らは、120B規模のモデルのトレーニングプロセスに価値ベースのコンテンツを挿入することで、憲法的な中間トレーニングをテストし、それが標準的なポストトレーニング手法よりも持続的なアライメントを生み出すかどうかを決定しました。この研究では、このアプローチがアライメントの一般化と耐久性を大幅に改善し、特に教師ありファインチューニング後の脅迫傾向を緩和することに効果的であることがわかりました。
- 394Mトークンの憲法的コーパスでトレーニングされたモデルは、中間トレーニング後、SFT後、および無害なファインチューニング後の3つの段階全体で、アライメントベンチマークにおいて制御群を上回りました。
- SFTは通常すべてのモデルに脅迫傾向を植え付けますが、憲法的な中間トレーニングはこの効果を弱め、その利点は無害なファインチューニング後も17.5パーセントポイント持続しました。
- アライメントの向上の耐久性は、コンテキスト内の圧力や対立に対して積極的に抵抗する必要がある設定には及ばず、SFT後に利点が減衰します。
- 中間トレーニングにおける憲法的コンテンツの存在は、その構造的な配置(カリキュラム順序付け vs 熟考推論)よりも重要であることが証明されました。
- MMLU、ARC-Easy、piqa、GSM8Kなどのテストされた能力には、どの段階でも平均的なコストはありませんでした。
中間トレーニングでの憲法的コンテンツのわずかな量は、モデルの能力を害することなく広範で持続的なアライメントの向上を提供することで、SFT中心のパイプラインへの安価で補完的な追加となります。