インド、西ベンガル州に拠点を置く独立したAI安全性研究者が、暗号化とセキュリティカテゴリの下でarXivに論文を投稿するための個人的な承認を依頼しています。この論文は、大規模言語モデルの安全性行動における漸進的な多ターン会話ドリフトのケーススタディを文書化しており、持続的な哲学的枠組みが宣言されたガイドラインと矛盾する出力と相関していることが示されています。

この研究はLogiBreakやH-CoTのような単一プロンプト攻撃ではなく、累積的な会話圧力に焦点を当てています。これは制御されたプロトコルや統計分析のない単一の観察者という認識された制限を持つ仮説生成ケーススタディとして明示的に位置づけられています。発見事項はGoogleのVRP、CERT-Inインド、およびCISA USAに正式に開示されました。

機関メールまたは以前に受理されたarXiv論文がないため、著者は自動承認の対象外であり、この公的な支援要請が必要となっています。