Независимый исследователь в области ИИ-безопасности, базирующийся в Западной Бенгалии, Индия, запрашивает личную поддержку для подачи статьи на arXiv в категории криптографии и безопасности. Статья документирует кейс-стади постепенного, многошагового дрейфа разговора в поведении безопасности больших языковых моделей, где устойчивое философское обрамление коррелирует с выводами, не соответствующими заявленным рекомендациям.
Работа фокусируется на кумулятивном разговорном давлении, а не на атаках с одним промптом, таких как LogiBreak или H-CoT. Она явно позиционируется как кейс-стади для генерации гипотез с признанными ограничениями, включая отсутствие контролируемых протоколов или статистического анализа единственным наблюдателем. Результаты были официально раскрыты VRP Google, CERT-In India и CISA USA.
Автор не соответствует критериям автоматической поддержки из-за отсутствия институциональной электронной почты или ранее принятых статей на arXiv, что обуславливает необходимость этого публичного запроса о помощи.