연구자들은 주요 대규모 언어 모델 제공업체가 단계별 추론 추적을 처리하는 방식의 아키텍처적 취약점을 발견했습니다. 제공업체는 이러한 추적을 클라이언트에게 암호화된 블록으로 반환하지만, 연구 결과 해당 블록은 제공업체 생태계 내의 서로 다른 세션, 사용자 및 모델 간에 완전히 호환되고 교체 가능함이 밝혀졌습니다.
- 연구자들은 동일한 제공업체의 강력한 모델에서 암호화된 추론 추적을 추출하여 덜 보호된 약한 모델에 주입함으로써 평문 출력을 유도하는 확장 가능한 탈출 jailbreak를 개발했습니다.
- 이 방법은 반-디스틸레이션 메커니즘을 우회하여 Anthropic, OpenAI 및 Google으로부터 독점 추론 추적을 추출할 수 있게 합니다.
- 이 취약점은 대규모 개인 데이터 추출을 가능하게 하며, 공개 저장소에서 수집한 315,320개의 추론 블록을 디코딩한 결과 367개의 PII 아티팩트와 182개의 자격 증명이 드러났습니다.
- 모델의 최종 출력이 요청을 안전하게 거부하더라도 이 결함은 우연히 추론 과정 내에 숨겨진 위험한 정보를 노출시킵니다.
- 공격자는 암호화된 블록 내에 악성 페이로드를 삽입하여 공개 에이전트 롤아웃을 오염시키는 보이지 않는 프롬프트 인젝션을 실행하는 데 이 결함을 사용할 수 있습니다.
책임 있는 공개 이후, 저자들은 클라이언트 측 추론을 보호하기 위한 구체적인 암호화 및 시스템 수준의 완화책을 제안했습니다.