Pesquisadores introduziram o ReasAlign, uma solução em nível de modelo projetada para melhorar o alinhamento de segurança em Grandes Modelos de Linguagem (LLMs) contra ataques de injeção indireta de prompt. A abordagem incorpora etapas de raciocínio estruturado para analisar consultas do usuário e detectar instruções conflitantes, garantindo a continuidade das tarefas pretendidas pelo usuário.
- O ReasAlign emprega um mecanismo de escalonamento em tempo de teste com um modelo juiz otimizado por preferência para pontuar as etapas de raciocínio e selecionar a melhor trajetória.
- No benchmark CyberSecEval2, ele atinge 94,6% de utilidade e apenas 3,6% de taxa de sucesso do ataque (ASR).
- Esse desempenho supera amplamente o Meta SecAlign, que registrou 56,4% de utilidade e 74,4% de ASR nas mesmas tarefas.
Os autores afirmam que o ReasAlign estabelece uma defesa robusta e prática contra ataques de injeção de prompt em sistemas agênticos do mundo real, ao alcançar a melhor compensação entre segurança e utilidade.