OpenAI는 Kimi의 개발자인 Moonshot AI와 관련된 개인들이 수행한 것으로 추정되는 조정된 적대적 증류(adversarial distillation) 캠페인을 식별하고 차단했습니다. 운영자들은 서비스 약관을 위반하여 OpenAI 모델에서 보호된 내부 추론을 추출하기 위해 모델 상호작용을 조작했습니다.
- 활동은 7월 1일에 시작되어 7월 24일과 25일에 4,000명 이상의 사용자로부터 16,000건의 요청으로 고빈도 급증으로 확대되었습니다.
- 관련 프롬프트 패턴 활동은 15,000명 이상의 사용자 클러스터 전반에서 식별되었으며, 7월 28일 완전히 차단되었습니다.
- 공격자들은 한 대화에서 암호화된 내용을 복사하고 다른 대화의 모델에 이를 복호화하도록 요청하여 추론을 추출하려 했습니다.
- OpenAI는 계정 조치, 기술적 통제 및 Frontier Model Forum과의 협력을 통해 이 캠페인을 완화했습니다.
회사는 적대적 증류가 원래의 안전 장치를 유지하지 않고도 모델 기능을 재현할 수 있게 함으로써 안전과 국가 안보에 위험을 초래한다고 경고합니다.