Pesquisas demonstram que serviços de modelos de linguagem grandes que dependem de defesas com estado para parar ataques de decomposição permanecem vulneráveis quando os atacantes usam identidades não vinculáveis e mecanismos de retry. O estudo prova que, sem sinais confiáveis de agrupamento para solicitações benignas, a compensação entre segurança e utilidade colapsa, pois o feedback permite que os atacantes aprendam quais consultas passam.
Experimentos em 91 tarefas executáveis e 11.393 solicitações benignas correspondidas por capacidade mostram que todas as dez políticas testadas falharam em parar ataques ou excederam orçamentos de negação sob limites rigorosos.
O sucesso do ataque atingiu pelo menos 99% após uma tentativa e 100% após duas tentativas em famílias de tarefas não vistas pela defesa, indicando que defesas eficazes requerem evidência adicional de agrupamento como vinculação de identidade ou custos para identidades novas.