OpenAI 发现并破坏了一项协调性的对抗性蒸馏活动,该活动被归因于与 Kimi 开发者月之暗面有关联的个人。操作者操纵模型交互,以违反服务条款的方式从 OpenAI 模型中提取受保护的内部推理。

  • 活动始于7月1日,在7月24日和25日激化为来自超过4,000名用户的16,000次请求的高容量峰值。
  • 在由超过15,000名用户组成的集群中识别出相关的提示模式活动,并于7月28日被完全破坏。
  • 攻击者试图通过从一个对话中复制加密内容并在另一个对话中要求模型解密来提取推理。
  • OpenAI 通过账户执行、技术控制以及与前沿模型论坛的协调来缓解该活动。

该公司警告称,对抗性蒸馏允许他人在不保留原始安全措施的情况下复制模型能力,从而带来安全和国家安全风险。