Исследователи выявили архитектурную уязвимость в том, как ведущие поставщики больших языковых моделей обрабатывают пошаговые цепочки рассуждений. Поставщики возвращают эти цепочки клиентам в виде зашифрованных блоков, однако исследование показывает, что эти блоки полностью совместимы и взаимозаменяемы между различными сессиями, пользователями и моделями внутри экосистемы одного провайдера.

  • Исследователи разработали масштабируемый обход ограничений (jailbreak) для дешифровки, внедрив зашифрованную цепочку рассуждений из мощной модели в более слабую, менее защищённую модель того же провайдера, чтобы принудительно получить вывод в открытом виде.
  • Этот метод позволяет обойти механизмы защиты от дистилляции, обеспечивая извлечение проприетарных цепочек рассуждений из Anthropic, OpenAI и Google.
  • Уязвимость позволяет осуществлять масштабное извлечение приватных данных; декодирование 315 320 блоков рассуждений, собранных из публичных репозиториев, выявило 367 артефактов PII (персональных данных) и 182 учётных данных.
  • Ошибка непреднамеренно раскрывает опасную информацию, скрытую внутри процесса рассуждения, даже когда финальный вывод модели безопасно отклоняет запрос.
  • Злоумышленники могут использовать эту ошибку для выполнения невидимых инъекций промптов, внедряя вредоносные payloads в зашифрованные блоки с целью отравления публичных агентных развертываний.

После ответственного раскрытия информации авторы предлагают конкретные криптографические и системные меры защиты для обеспечения безопасности клиентских рассуждений.