OpenAIは、Kimiの開発者であるMoonshot AIに関連する個人が関与しているとされる協調的な敵対的蒸留キャンペーンを特定し、妨害した。作業者はモデルとの相互作用を操作し、利用規約に違反してOpenAIモデルから保護された内部推論を抽出しようとした。
- 7月1日に活動が始まり、7月24日と25日には4,000人以上のユーザーから16,000件のリクエストという大量のスパイクにエスカレートした。
- 15,000人以上のユーザーのクラスター全体で関連するプロンプトパターンの活動が特定され、7月28日までに完全に妨害された。
- アタッカーは、ある会話から暗号化されたコンテンツをコピーし、別のモデルにそれを復号させることで推論の抽出を試みた。
- OpenAIは、アカウント執行、技術的制御、およびFrontier Model Forumとの連携を通じてキャンペーンを緩和した。
同社は、敵対的蒸留が元の保護策を維持せずにモデルの能力を他者が再現できるようにすることで、安全性と国家安全保障上のリスクをもたらすと警告している。