Um documento de posição de pesquisadores da NVIDIA descreve uma visão para proteger agentes de IA contra ataques de injeção indireta de prompts, onde instruções maliciosas embutidas em dados não confiáveis desencadeiam ações perigosas. Os autores argumentam que a defesa eficaz requer ir além de correções isoladas do modelo para arquiteturas abrangentes em nível de sistema.
- O replanejamento dinâmico e as atualizações de políticas de segurança são necessários para lidar com tarefas dinâmicas e ambientes realistas.
- As decisões de segurança dependentes do contexto devem depender de LLMs apenas dentro de designs que restrinjam estritamente o que o modelo pode observar e decidir.
- A personalização e a interação humana devem ser considerações centrais de design para casos inerentemente ambíguos.
- Os benchmarks existentes frequentemente criam uma falsa sensação de utilidade e segurança devido às suas limitações.
As defesas em nível de sistema servem como o esqueleto estrutural para sistemas agênticos, integrando verificações baseadas em regras e modelos, permitindo pesquisas mais direcionadas sobre robustez.