В статье Multiverse Computing представлен метод обучения языковых моделей отказывать только в конкретных вредных подкатегориях темы, а не во всей категории целиком, что позволяет преодолеть ограничения грубых тематических ограничителей. Подход использует самодистилляцию с учётом границ вместе с восстановлением покрытия и доброкачественными данными из того же распределения, чтобы сохранить безопасность при одновременном снижении ложных отказов на легитимные запросы.

  • Стратегия эскалирующих повторных попыток снижает количество сбоев генерации запросов с 19,88% до 0,20%, сохраняя 40 293 примера для обучения на вредных данных.
  • Включение 11 955 проверенных доброкачественных запросов, внешне выглядящих опасными, смягчает ложные отказы на безопасном контенте.
  • Отложенная выборка пар «вредное–доброкачественное» позволяет напрямую измерять точность границы: добавление данных о границе с доброкачественными примерами снижает чрезмерный отказ с 32,94% до 4,16% при незначительном падении отказа от вредных запросов (с 91,88% до 87,72%).

Авторы утверждают, что настройка безопасности должна оценивать как вредную, так и доброкачественную стороны границы, поскольку оптимизация только по отказу от вредных запросов может сделать модели бесполезными для легитимных запросов.