Исследователи представили ReasAlign, решение на уровне модели, предназначенное для улучшения безопасности выравнивания больших языковых моделей (LLM) против косвенных атак с инъекцией промптов. Подход включает структурированные шаги рассуждения для анализа пользовательских запросов и выявления конфликтующих инструкций, обеспечивая непрерывность задач, задуманных пользователем.

  • ReasAlign использует механизм масштабирования во время тестирования с предпочтительно оптимизированной моделью-судьей для оценки шагов рассуждения и выбора наилучшей траектории.
  • На бенчмарке CyberSecEval2 он достигает 94,6% полезности и лишь 3,6% успешности атаки (ASR).
  • Эта производительность значительно превосходит Meta SecAlign, который показал 56,4% полезности и 74,4% ASR на тех же задачах.

Авторы утверждают, что ReasAlign обеспечивает надежную и практичную защиту от атак с инъекцией промптов в реальных агентных системах, достигая наилучшего компромисса между безопасностью и полезностью.