Un document de position des chercheurs de NVIDIA décrit une vision pour sécuriser les agents IA contre les attaques par injection indirecte de prompts, où des instructions malveillantes intégrées dans des données non fiables déclenchent des actions dangereuses. Les auteurs soutiennent qu'une défense efficace nécessite de dépasser les correctifs isolés du modèle au profit d'architectures complètes au niveau du système.

  • La replanification dynamique et les mises à jour des politiques de sécurité sont nécessaires pour gérer les tâches dynamiques et les environnements réalistes.
  • Les décisions de sécurité dépendantes du contexte ne doivent reposer sur les LLM que dans des conceptions qui contraignent strictement ce que le modèle peut observer et décider.
  • La personnalisation et l'interaction humaine doivent être des considérations centrales de conception pour les cas intrinsèquement ambigus.
  • Les benchmarks existants créent souvent un faux sentiment d'utilité et de sécurité en raison de leurs limites.

Les défenses au niveau du système servent de squelette structurel aux systèmes agents en intégrant des vérifications basées sur des règles et des modèles, permettant une recherche plus ciblée sur la robustesse.