Позиционный документ исследователей NVIDIA описывает видение обеспечения безопасности ИИ-агентов от атак с косвенной инъекцией промптов, где вредоносные инструкции, встроенные в ненадежные данные, вызывают опасные действия. Авторы утверждают, что эффективная защита требует выхода за рамки изолированных исправлений моделей к комплексным системным архитектурам.
- Динамическое перепланирование и обновление политик безопасности необходимы для обработки динамических задач и реалистичных сред.
- Решения о безопасности, зависящие от контекста, должны опираться на LLM только в рамках архитектур, строго ограничивающих то, что модель может наблюдать и решать.
- Персонализация и взаимодействие с человеком должны быть ключевыми соображениями дизайна для по своей природе неоднозначных случаев.
- Существующие бенчмарки часто создают ложное чувство полезности и безопасности из-за своих ограничений.
Системные защиты служат структурным скелетом для агентных систем, интегрируя проверки на основе правил и моделей, что позволяет проводить более целенаправленные исследования устойчивости.