Un article de Multiverse Computing présente une méthode pour entraîner les modèles de langage à refuser uniquement des sous-ensembles spécifiques nuisibles d'un sujet, plutôt que toute la catégorie, afin de pallier les limites des garde-fous bruts au niveau du sujet. L'approche utilise une auto-distillation sensible aux limites avec réparation de la couverture et des données bénignes dans la distribution pour maintenir la sécurité tout en réduisant les faux rejets sur les invites légitimes.
- Une stratégie de réessai croissante réduit les échecs de génération d'invites de 19,88 % à 0,20 %, préservant 40 293 exemples d'entraînement nuisibles.
- L'inclusion de 11 955 invites bénignes vérifiées comme dangereuses en surface atténue les faux rejets sur le contenu sûr.
- Des paires nuisibles-bénignes tenues à l'écart mesurent directement la précision des limites, montrant que l'ajout de données de limite bénignes réduit le sur-refus de 32,94 % à 4,16 % avec une légère baisse du refus nuisible (de 91,88 % à 87,72 %).
Les auteurs soutiennent que l'ajustement de la sécurité doit évaluer les deux côtés de la limite, nuisibles et bénins, car optimiser uniquement le refus nuisible peut rendre les modèles inutiles pour les requêtes légitimes.