研究人员形式化了推理时拒绝服务(PI-DoS)攻击,这些攻击利用了大型推理模型(LRMs)中显式多步推理的高计算成本。他们提出了 ReasoningBomb,这是一个基于强化学习的框架,训练攻击者生成简短的自然提示,使受害模型陷入病态长且通常不终止的推理轨迹。

  • 在七个开源模型和三个商业 LRM 上,ReasoningBomb 平均引发 18,759 个完成 token 和 19,263 个推理 token。
  • 该方法在 completion tokens 方面比第二名基线高出 35%,在 reasoning tokens 方面高出 38%。
  • 与良性查询相比,它平均实现了 286.7 倍的输入到输出放大比率。
  • ReasoningBomb 以 99.8% 的成功率绕过基于输入的检测,以 98.7% 的成功率绕过基于输出的检测,并以 98.4% 的成功率绕过严格的二阶段联合检测。

这项工作凸显了 LRM 中的新漏洞,其中扩展推理的能力可以被武器化,通过隐蔽的提示工程造成严重的拒绝服务状况。