연구자들은 대규모 언어 모델(LLM)의 간접 프롬프트 인젝션 공격에 대한 안전 정렬을 개선하도록 설계된 모델 수준의 솔루션인 ReasAlign을 소개했습니다. 이 접근 방식은 사용자 쿼리를 분석하고 상충되는 지시를 감지하여 사용자의 의도된 작업의 연속성을 보장하기 위해 구조화된 추론 단계를 통합합니다.
- ReasAlign은 선호도 최적화 판정 모델을 사용하여 추론 단계에 점수를 매기고 최상의 궤적을 선택하는 테스트 타임 스케일링 메커니즘을 사용합니다.
- CyberSecEval2 벤치마크에서 94.6%의 유틸리티와 단 3.6%의 공격 성공률(ASR)을 달성했습니다.
- 이 성능은 동일한 작업에서 56.4%의 유틸리티와 74.4%의 ASR을 기록한 Meta SecAlign을 크게 상회합니다.
저자들은 ReasAlign이 보안과 유틸리티 간의 최상의 균형을 달성함으로써 실제 세계 에이전트 시스템에서 프롬프트 인젝션 공격에 대해 강력하고 실용적인 방어 체계를 확립한다고 밝혔습니다.