Исследователи выявили уязвимость в том, как ведущие провайдеры больших языковых моделей обрабатывают пошаговые цепочки рассуждений, которые возвращаются в виде зашифрованных блоков для использования на стороне клиента. Они обнаружили, что эти зашифрованные блоки полностью совместимы и взаимозаменяемы между различными сессиями, пользователями и моделями в рамках экосистемы одного провайдера.

  • Команда разработала масштабируемый обход защиты путём внедрения зашифрованной цепочки рассуждений из мощной модели в более слабую, менее защищённую модель, чтобы принудить её вывести цепочку в открытом виде.
  • Этот метод позволяет обойти механизмы анти-дистилляции, обеспечивая извлечение проприетарных цепочек рассуждений от таких провайдеров, как Anthropic, OpenAI и Google.
  • Уязвимость позволяет осуществлять масштабное извлечение частных данных; декодирование 315 320 блоков рассуждений, собранных из публичных репозиториев, выявило 367 артефактов PII и 182 учётных данных.
  • Ошибка непреднамеренно раскрывает опасную информацию, скрытую в процессе рассуждения, даже когда финальный вывод модели безопасно отклоняет вредоносный запрос.
  • Атакующие могут использовать эту ошибку для выполнения невидимых инъекций промптов, внедряя вредоносные payloads в зашифрованные блоки для отравления публичных агентных развертываний.

После ответственного раскрытия авторы предлагают конкретные криптографические и системные меры защиты для обеспечения безопасности клиентских рассуждений.