Исследователи формализовали атаки на отказ в обслуживании во время вывода (PI-DoS), которые используют высокую вычислительную стоимость явного многошагового рассуждения в больших моделях рассуждения (LRM). Они представляют ReasoningBomb — основанную на обучении с подкреплением систему, которая обучает атакующего генерировать короткие естественные промпты, заставляющие модели-жертвы вступать в патологически длинные и часто не завершающиеся цепочки рассуждений.

  • На семи моделях с открытым исходным кодом и трех коммерческих LRM ReasoningBomb вызывает в среднем 18 759 токенов завершения и 19 263 токена рассуждения.
  • Метод превосходит ближайшего конкурента на 35% по количеству токенов завершения и на 38% по количеству токенов рассуждения.
  • Он достигает среднего коэффициента усиления от входа к выходу 286,7x по сравнению с безобидными запросами.
  • ReasoningBomb обходит обнаружение с успешностью 99,8% для методов на основе ввода, 98,7% для методов на основе вывода и 98,4% против строгого двухэтапного совместного обнаружения.

Эта работа подчеркивает новую уязвимость в LRM, где способность к расширенному рассуждению может быть использована как оружие для создания серьезных условий отказа в обслуживании посредством скрытого конструирования промптов.