Новая статья демонстрирует, что зашифрованные блоки рассуждения от передовых моделей, таких как Claude, GPT и Gemini, могут быть расшифрованы и воспроизведены для извлечения скрытых данных цепочки рассуждений. Авторы показывают, как эти подписанные блоки можно передать более слабым моделям или другим сессиям для транскрибации исходных мыслей, эффективно обходя усилия провайдеров по маскировке.

  • Сканирование примерно 7000 публичных трасс выявило утечку конфиденциальных данных, включая 62 уникальных ключа API, 33 адреса электронной почты и 33 пароля, скрытых исключительно в блоках рассуждения.
  • Техника включает получение легитимного зашифрованного блока, его воспроизведение в другом запросе или более слабой модели от того же провайдера и использование специфических промптов для принудительной транскрибации прикрепленного рассуждения.
  • Для Claude (воспроизведение в Haiku 4.5), GPT (внедрение зашифрованного контента с фрагментированными продолжениями) и Gemini (прикрепление сигнатур мыслей) были подробно описаны конкретные методы.
  • Уязвимость вызывает серьезные опасения по поводу конфиденциальности, так как общие трассы могут привести к утечке личных данных, а также усложняет мониторинг выравнивания из-за краткости или фрагментарности расшифрованных мыслей.

Статья была ответственно раскрыта, и несколько уязвимостей уже исправлены, но результаты подчеркивают сохраняющиеся риски в том, как передовые лаборатории обрабатывают и защищают внутренние процессы рассуждения.