Исследователи представили ReasAlign, решение на уровне модели, предназначенное для улучшения безопасности выравнивания больших языковых моделей (LLM) против косвенных атак с инъекцией промптов. Подход включает структурированные шаги рассуждения для анализа пользовательских запросов и выявления конфликтующих инструкций, обеспечивая непрерывность задач, задуманных пользователем.
- ReasAlign использует механизм масштабирования во время тестирования с предпочтительно оптимизированной моделью-судьей для оценки шагов рассуждения и выбора наилучшей траектории.
- На бенчмарке CyberSecEval2 он достигает 94,6% полезности и лишь 3,6% успешности атаки (ASR).
- Эта производительность значительно превосходит Meta SecAlign, который показал 56,4% полезности и 74,4% ASR на тех же задачах.
Авторы утверждают, что ReasAlign обеспечивает надежную и практичную защиту от атак с инъекцией промптов в реальных агентных системах, достигая наилучшего компромисса между безопасностью и полезностью.