Un artículo de Multiverse Computing presenta un método para entrenar modelos de lenguaje a rechazar solo subconjuntos específicos dañinos de un tema, en lugar de toda la categoría, abordando las limitaciones de las barreras de guardia ciegas a nivel de tema. El enfoque utiliza auto-distilación consciente de límites con reparación de cobertura y datos benignos dentro de la distribución para mantener la seguridad mientras se reducen los falsos rechazos en solicitudes legítimas.

  • La estrategia de reintento escalonada reduce las fallas de generación de prompts del 19,88% al 0,20%, preservando 40.293 ejemplos dañinos de entrenamiento.
  • La inclusión de 11.955 prompts benignos verificados superficialmente peligrosos mitiga los falsos rechazos en contenido seguro.
  • Los pares dañino-benigno retenidos miden directamente la precisión del límite, mostrando que añadir datos de límite benigno reduce el sobre-rechazo del 32,94% al 4,16% con solo una pequeña caída en el rechazo dañino (del 91,88% al 87,72%).

Los autores argumentan que el ajuste de seguridad debe evaluar ambos lados del límite, tanto los dañinos como los benignos, ya que optimizar únicamente para el rechazo dañino puede volver inútiles a los modelos en consultas legítimas.