연구자들은 주요 대규모 언어 모델 제공업체들이 클라이언트 측 사용을 위해 암호화된 블록으로 반환하는 단계별 추론 추적을 처리하는 방식에서 취약점을 발견했습니다. 그들은 이러한 암호화된 블록이 동일한 제공업체의 생태계 내의 서로 다른 세션, 사용자 및 모델 간에 완전히 호환되고 교체 가능함을 확인했습니다.

  • 연구진은 강력한 모델에서 암호화된 추론 추적을 약하고 보호 장치가 덜 된 모델에 주입하여 평문으로 추론을 출력하도록 강요하는 확장 가능한 탈출 jailbreak를 개발했습니다.
  • 이 방법은 반디스틸레이션 메커니즘을 우회하여 Anthropic, OpenAI, Google을 포함한 제공업체로부터 독점적인 추론 추적을 추출할 수 있게 합니다.
  • 이 취약점은 대규모 개인 데이터 추출을 가능하게 하며, 공개 저장소에서 수집한 315,320개의 추론 블록을 디코딩하는 결과 367개의 PII 아티팩트와 182개의 자격 증명이 드러났습니다.
  • 이 결함은 모델의 최종 출력이 악성 요청을 안전하게 거부하더라도 추론 과정에 숨겨진 위험한 정보를 우연히 노출시킵니다.
  • 공격자들은 암호화된 블록 내에 악성 페이로드를 삽입하여 공개 에이전트 롤아웃을 오염시키는 보이지 않는 프롬프트 인젝션을 실행하는 데 이 결함을 사용할 수 있습니다.

책임 있는 공개 후, 저자들은 클라이언트 측 추론을 보호하기 위한 구체적인 암호화 및 시스템 수준의 완화책을 제안합니다.