Multiverse Computingの研究論文は、言語モデルがトピック全体ではなく有害なサブセットのみを拒否するように訓練する手法を導入し、粗いトピックレベルのガードレールの限界に対処しています。このアプローチは、カバーレッジ修復と分布内良性データを用いた境界認識自己蒸留により、安全性を維持しつつ正当なプロンプトに対する誤った拒否を減らします。
- エスカレーション型リトライ戦略により、プロンプト生成の失敗が19.88%から0.20%に減少し、40,293件の有害な訓練例が保持されました。
- 11,955件の検証済み表面有害な良性プロンプトを含めることで、安全なコンテンツに対する誤った拒否を緩和します。
- ホールドアウトされた有害-良性ペアは境界の精度を直接測定し、良性の境界データを追加することで過剰拒否が32.94%から4.16%に減少し、有害拒否はわずかに低下するのみ(91.88%から87.72%)であることを示しています。
著者らは、安全なチューニングでは境界の有害側と良性側の両方を評価する必要があり、有害拒否のみを最適化するとモデルが正当なクエリに対して役に立たなくなる可能性があると考えています。