Pesquisadores introduziram o ReasAlign, uma solução em nível de modelo projetada para melhorar o alinhamento de segurança em Grandes Modelos de Linguagem (LLMs) contra ataques de injeção indireta de prompt. A abordagem incorpora etapas de raciocínio estruturado para analisar consultas do usuário e detectar instruções conflitantes, garantindo a continuidade das tarefas pretendidas pelo usuário.

  • O ReasAlign emprega um mecanismo de escalonamento em tempo de teste com um modelo juiz otimizado por preferência para pontuar as etapas de raciocínio e selecionar a melhor trajetória.
  • No benchmark CyberSecEval2, ele atinge 94,6% de utilidade e apenas 3,6% de taxa de sucesso do ataque (ASR).
  • Esse desempenho supera amplamente o Meta SecAlign, que registrou 56,4% de utilidade e 74,4% de ASR nas mesmas tarefas.

Os autores afirmam que o ReasAlign estabelece uma defesa robusta e prática contra ataques de injeção de prompt em sistemas agênticos do mundo real, ao alcançar a melhor compensação entre segurança e utilidade.