Multiverse Computing의 논문은 전체 카테고리 대신 특정 주제 내 해로운 하위 집합에만 거부하도록 언어 모델을 훈련시키는 방법을 소개하며, 이는 둔감한 주제 수준 가드레일의 한계를 해결합니다. 이 접근법은 안전성을 유지하면서 정당한 프롬프트에 대한 거짓 거부를 줄이기 위해 커버리지 복원과 분포 내 양성 데이터를 사용한 경계 인식 자가 증류를 사용합니다.
- 점증적 재시도 전략은 프롬프트 생성 실패율을 19.88%에서 0.20%로 낮추고, 40,293개의 해로운 훈련 예제를 보존합니다.
- 11,955개의 검증된 표면상 위험한 양성 프롬프트의 포함은 안전한 콘텐츠에 대한 거짓 거부를 완화합니다.
- 홀드아웃 해로운-양성 쌍은 경계 정밀도를 직접 측정하며, 양성 경계 데이터를 추가하면 해로운 거부율(91.88%에서 87.72%)이 약간 하락하는 동안 과거부율이 32.94%에서 4.16%로 줄어듦을 보여줍니다.
저자들은 안전성 튜닝이 경계의 해로운 측면과 양성 측면 모두를 평가해야 한다고 주장하며, 해로운 거부만 최적화하면 모델이 정당한 쿼리에서 무용지물이 될 수 있다고 말합니다.