研究により、分解攻撃を防ぐために状態保持防御に依存する大規模言語モデルサービスは、攻撃者がリンク不可能なIDと再試行メカニズムを使用する場合に脆弱であることが示されています。研究は、良性リクエストに対する信頼できるグループ化シグナルがない場合、フィードバックによって攻撃者がどのクエリが通過するかを学習できるため、セキュリティとユーティリティのトレードオフが崩壊することを証明しています。

91の実行可能タスクと11,393件の能力マッチングされた良性リクエストでの実験により、テストされた10つのポリシーすべてが攻撃を防げなかったか、厳格な制限下で拒否予算を超えたことが示されました。

防御未見のタスクファミリーにおいて、1回の試行後少なくとも99%、2回の試行後100%の攻撃成功率に達し、効果的な防御にはIDリンクや新規IDのコストなどの追加グループ化証拠が必要であることを示しています。