一位常驻印度西孟加拉邦的独立 AI 安全研究人员正在请求个人背书,以便在 arXiv 的密码学与安全类别下提交论文。该文件记录了一项关于大型语言模型安全行为中渐进式、多轮对话漂移的案例研究,其中持续的哲学框架与偏离既定指南的输出相关。

这项工作侧重于累积性对话压力,而非 LogiBreak 或 H-CoT 等单次提示攻击。它明确被框定为具有公认局限性的假设生成案例研究,局限性包括由单一观察者进行且缺乏受控协议或统计分析。这些发现已正式向 Google VRP、印度 CERT-In 和美国 CISA 披露。

由于缺乏机构电子邮件地址或此前被 arXiv 接受的论文,作者不符合自动背书资格,因此需要此公开求助。