Un documento de posición de investigadores de NVIDIA describe una visión para proteger a los agentes de IA contra ataques de inyección indirecta de prompts, donde instrucciones maliciosas incrustadas en datos no confiables desencadenan acciones peligrosas. Los autores argumentan que la defensa efectiva requiere ir más allá de las correcciones aisladas del modelo hacia arquitecturas integrales a nivel de sistema.

  • La replanificación dinámica y las actualizaciones de políticas de seguridad son necesarias para manejar tareas dinámicas y entornos realistas.
  • Las decisiones de seguridad dependientes del contexto deben basarse en LLM solo dentro de diseños que restrinjan estrictamente lo que el modelo puede observar y decidir.
  • La personalización y la interacción humana deben ser consideraciones centrales de diseño para casos inherentemente ambiguos.
  • Los benchmarks existentes a menudo crean una falsa sensación de utilidad y seguridad debido a sus limitaciones.

Las defensas a nivel de sistema sirven como el esqueleto estructural para los sistemas agénticos al integrar verificaciones basadas en reglas y modelos, permitiendo una investigación más dirigida sobre la robustez.