독립 AI 보안 연구원 Krishnakaanth Reddy Yeduguru는 "RedSOC — LLM 통합 보안 운영 센터를 위한 적대적 평가 프레임워크"라는 제목의 논문(arXiv cs.CR 카테고리)에 대한 승인을 요청하고 있습니다.

이 연구는 간접 프롬프트 주입에 대한 100% 공격 성공률(ASR)과 코퍼스 오염에 대한 80% ASR을 포함한 주요 결과를 제시합니다. 또한 제안된 탐지 레이어는 모델 내부 정보 없이도 15개의 시나리오와 10번의 독립적인 실행에서 100% 탐지율을 달성했습니다.

저자는 arXiv 검토 과정을 촉진하기 위해 승인 코드(3RCVLY)를 제공합니다.