Multiverse Computing的一篇论文介绍了一种训练语言模型仅拒绝特定有害子集而非整个类别的方法,以解决粗粒度主题级护栏的局限性。该方法使用带有覆盖修复和分布内良性数据的边界感知自蒸馏,在降低对合法提示误拒的同时保持安全性。

  • 逐步重试策略将提示生成失败率从19.88%降至0.20%,保留了40,293个有害训练样本。
  • 纳入11,955个经验证的表面危险良性提示,缓解了安全内容上的误拒问题。
  • 使用保留的有害-良性对直接测量边界精度,表明添加良性边界数据将过度拒绝率从32.94%降至4.16%,同时有害拒绝率仅轻微下降(从91.88%降至87.72%)。

作者认为,安全调优必须评估边界的有害和良性两侧,因为仅优化有害拒绝可能导致模型在合法查询中失效。