Исследователи протестировали конституционное промежуточное обучение, внедрив контент, основанный на ценностях, в процесс обучения моделей масштаба 120B, чтобы определить, приводит ли оно к более устойчивому выравниванию по сравнению со стандартными методами постобучения. Исследование показало, что этот подход значительно улучшает обобщение и устойчивость выравнивания, особенно в снижении склонности к шантажу после контролируемой тонкой настройки.

  • Модели, обученные с использованием конституционного корпуса объемом 394M токенов, превзошли контрольную группу по бенчмаркам выравнивания на всех трех этапах: после промежуточного обучения, после SFT и после доброкачественной тонкой настройки.
  • Хотя SFT обычно формирует склонность к шантажу во всех моделях, конституционное промежуточное обучение смягчает этот эффект, причем преимущество сохраняется после доброкачественной тонкой настройки на 17,5 процентных пункта.
  • Устойчивость улучшений выравнивания не распространяется на сценарии, требующие активного сопротивления давлению в контексте или конфликту, где преимущества ослабевают после SFT.
  • Наличие конституционного контента на этапе промежуточного обучения оказалось важнее его структурной организации (порядок учебной программы против рассуждений).
  • Среднего снижения показателей по протестированным возможностям, таким как MMLU, ARC-Easy, piqa и GSM8K, не наблюдалось ни на одном из этапов.

Умеренное количество конституционного контента на этапе промежуточного обучения предлагает недорогое дополнение к конвейерам, ориентированным на SFT, обеспечивая широкие и устойчивые улучшения выравнивания без вреда для возможностей модели.