인도 서벵골에 기반을 둔 독립 AI 안전 연구원이 암호학 및 보안 카테고리 하에 arXiv에 논문을 제출하기 위한 개인 승인을 요청하고 있습니다. 이 논문은 대규모 언어 모델의 안전 행동에서 점진적이고 다중 턴 대화 드리프트에 대한 사례 연구를 문서화하며, 지속적인 철학적 프레임워크가 명시된 가이드라인과 일치하지 않는 출력과 상관관계가 있음을 보여줍니다.
이 작업은 LogiBreak나 H-CoT와 같은 단일 프롬프트 공격보다 누적 대화 압력에 초점을 맞춥니다. 이는 통제된 프로토콜이나 통계 분석 없이 단일 관찰자라는 인정된 제한 사항이 있는 가설 생성 사례 연구로 명시적으로 프레임됩니다. 발견 사항은 Google의 VRP, CERT-In 인도 및 CISA USA에 공식적으로 공개되었습니다.
기관 이메일이나 이전에 승인된 arXiv 논문이 부족하여 저자는 자동 승인 자격이 없으므로 이 공개적인 도움 요청이 필요합니다.