Um artigo da Computação Multiverso apresenta um método para treinar modelos de linguagem a recusar apenas subconjuntos específicos prejudiciais de um tópico, em vez de toda a categoria, abordando as limitações das barreiras de tópicos grosseiras. A abordagem utiliza auto-distilação consciente de fronteira com reparo de cobertura e dados benignos na distribuição para manter a segurança enquanto reduz recusas falsas em prompts legítimos.

  • Estratégia de retry escalonada reduz falhas de geração de prompt de 19,88% para 0,20%, preservando 40.293 exemplos prejudiciais de treinamento.
  • Inclusão de 11.955 prompts benignos verificados superficialmente perigosos mitiga recusas falsas em conteúdo seguro.

Pares prejudiciais-benignos retidos medem a precisão da fronteira diretamente, mostrando que adicionar dados de fronteira benigna reduz a sobre-recusa de 32,94% para 4,16% com apenas uma pequena queda na recusa prejudicial (de 91,88% para 87,72%).

Os autores argumentam que o ajuste de segurança deve avaliar ambos os lados da fronteira, prejudicial e benigno, pois otimizar apenas para a recusa prejudicial pode tornar os modelos inúteis para consultas legítimas.