Les chercheurs ont présenté ReasAlign, une solution au niveau du modèle conçue pour améliorer l'alignement de sécurité des grands modèles de langage (LLM) contre les attaques par injection indirecte de prompts. L'approche intègre des étapes de raisonnement structurées pour analyser les requêtes utilisateur et détecter les instructions conflictuelles, garantissant la continuité des tâches prévues par l'utilisateur.

  • ReasAlign utilise un mécanisme de mise à l'échelle au moment du test avec un modèle juge optimisé par préférence pour évaluer les étapes de raisonnement et sélectionner la meilleure trajectoire.
  • Sur le benchmark CyberSecEval2, il atteint 94,6 % d'utilité et seulement 3,6 % de taux de réussite des attaques (ASR).
  • Cette performance dépasse largement Meta SecAlign, qui a enregistré 56,4 % d'utilité et 74,4 % d'ASR sur les mêmes tâches.

Les auteurs affirment que ReasAlign établit une défense robuste et pratique contre les attaques par injection de prompts dans les systèmes agents du monde réel en atteignant le meilleur compromis entre sécurité et utilité.