В статье показано, что зашифрованные блоки цепочки рассуждений (chain-of-thought), возвращаемые Anthropic, OpenAI и Google, могут быть извлечены в виде открытого текста. Авторы воспользовались уязвимостью, при которой модели одного семейства использовали общие ключи шифрования, что позволило им воспроизводить эти блоки для более слабых моделей-«собратьев».

  • Подавая зашифрованные блоки рассуждений от более мощных моделей в более слабые, такие как Claude Haiku 4.5, злоумышленники могли обойти защиту модели и получить доступ к необработанному незашифрованному содержимому.
  • Атака использовала специфические техники инъекции промптов, например, инструктируя модель дословно транскрибировать прикреплённые рассуждения внутри пользовательских тегов.
  • Модели считали свои собственные цепочки рассуждений неприкосновенными, что делало их крайне уязвимыми к выполнению инструкций, встроенных в эти воспроизведённые фрагменты.

В статье отмечается, что этот метод раскрывает внутренние токены рассуждений, которые никогда не предназначались для потребления человеком, и выявляет новый вариант инъекции промптов. Однако авторы отмечают, что все поставщики моделей признали отчёт и впоследствии устранили уязвимость.