Позиционный документ исследователей NVIDIA описывает видение обеспечения безопасности ИИ-агентов от атак с косвенной инъекцией промптов, где вредоносные инструкции, встроенные в ненадежные данные, вызывают опасные действия. Авторы утверждают, что эффективная защита требует выхода за рамки изолированных исправлений моделей к комплексным системным архитектурам.

  • Динамическое перепланирование и обновление политик безопасности необходимы для обработки динамических задач и реалистичных сред.
  • Решения о безопасности, зависящие от контекста, должны опираться на LLM только в рамках архитектур, строго ограничивающих то, что модель может наблюдать и решать.
  • Персонализация и взаимодействие с человеком должны быть ключевыми соображениями дизайна для по своей природе неоднозначных случаев.
  • Существующие бенчмарки часто создают ложное чувство полезности и безопасности из-за своих ограничений.

Системные защиты служат структурным скелетом для агентных систем, интегрируя проверки на основе правил и моделей, что позволяет проводить более целенаправленные исследования устойчивости.