研究表明,依赖有状态防御来阻止分解攻击的大型语言模型服务在攻击者使用不可链接的身份和重试机制时仍然容易受到攻击。该研究证明,如果没有用于良性请求的可靠分组信号,安全与效用之间的权衡就会崩溃,因为反馈允许攻击者了解哪些查询能够通过。

在91个可执行任务和11,393个能力匹配的良性请求上的实验表明,所有十项测试策略在严格限制下要么未能阻止攻击,要么超过了拒绝预算。

在未见过任务的家族中,一次尝试后攻击成功率至少达到99%,两次尝试后达到100%,这表明有效的防御需要额外的分组证据,如身份链接或新身份的代价。