Sebuah makalah dari Multiverse Computing memperkenalkan metode untuk melatih model bahasa agar menolak hanya subset berbahaya tertentu dari suatu topik, alih-alih seluruh kategori, guna mengatasi keterbatasan guardrail berbasis topik yang kasar. Pendekatan ini menggunakan self-distillation yang sadar batas dengan perbaikan cakupan dan data benign dalam distribusi untuk menjaga keamanan sambil mengurangi penolakan palsu pada prompt yang sah.
- Strategi retry yang meningkat mengurangi kegagalan pembuatan prompt dari 19,88% menjadi 0,20%, mempertahankan 40.293 contoh pelatihan berbahaya.
- Inklusi 11.955 prompt benign yang terverifikasi berisiko permukaan mitigasi penolakan palsu pada konten aman.
- Pasangan harmful-benign yang dihold-out mengukur presisi batas secara langsung, menunjukkan bahwa penambahan data batas benign mengurangi over-refusal dari 32,94% menjadi 4,16% dengan penurunan kecil pada penolakan berbahaya (dari 91,88% menjadi 87,72%).
Para penulis berargumen bahwa tuning keamanan harus mengevaluasi kedua sisi berbahaya dan benign dari batas tersebut, karena mengoptimalkan hanya untuk penolakan berbahaya dapat membuat model tidak berguna pada kueri yang sah.