La investigación demuestra que los servicios de modelos de lenguaje grandes que dependen de defensas con estado para detener ataques de descomposición siguen siendo vulnerables cuando los atacantes utilizan identidades no vinculables y mecanismos de reintento. El estudio demuestra que sin señales de agrupación confiables para solicitudes benignas, la compensación entre seguridad y utilidad se colapsa ya que el retroalimentación permite a los atacantes aprender qué consultas pasan.
Los experimentos en 91 tareas ejecutables y 11.393 solicitudes benignas emparejadas por capacidad muestran que las diez políticas probadas no lograron detener los ataques o excedieron los presupuestos de denegación bajo límites estrictos.
El éxito del ataque alcanzó al menos el 99% después de un intento y el 100% después de dos intentos en familias de tareas no vistas por la defensa, lo que indica que las defensas efectivas requieren evidencia adicional de agrupación como vinculación de identidad o costos para identidades nuevas.