Исследователи выявили архитектурную уязвимость в том, как ведущие поставщики больших языковых моделей обрабатывают пошаговые цепочки рассуждений. Поставщики возвращают эти цепочки клиентам в виде зашифрованных блоков, однако исследование показывает, что эти блоки полностью совместимы и взаимозаменяемы между различными сессиями, пользователями и моделями внутри экосистемы одного провайдера.
- Исследователи разработали масштабируемый обход ограничений (jailbreak) для дешифровки, внедрив зашифрованную цепочку рассуждений из мощной модели в более слабую, менее защищённую модель того же провайдера, чтобы принудительно получить вывод в открытом виде.
- Этот метод позволяет обойти механизмы защиты от дистилляции, обеспечивая извлечение проприетарных цепочек рассуждений из Anthropic, OpenAI и Google.
- Уязвимость позволяет осуществлять масштабное извлечение приватных данных; декодирование 315 320 блоков рассуждений, собранных из публичных репозиториев, выявило 367 артефактов PII (персональных данных) и 182 учётных данных.
- Ошибка непреднамеренно раскрывает опасную информацию, скрытую внутри процесса рассуждения, даже когда финальный вывод модели безопасно отклоняет запрос.
- Злоумышленники могут использовать эту ошибку для выполнения невидимых инъекций промптов, внедряя вредоносные payloads в зашифрованные блоки с целью отравления публичных агентных развертываний.
После ответственного раскрытия информации авторы предлагают конкретные криптографические и системные меры защиты для обеспечения безопасности клиентских рассуждений.