A OpenAI identificou e interrompeu uma campanha coordenada de destilação adversarial atribuída a indivíduos associados à Moonshot AI, desenvolvedora do Kimi. Os operadores manipularam as interações com o modelo para extrair o raciocínio interno protegido dos modelos da OpenAI, violando os termos de serviço.

  • A atividade começou em 1º de julho, escalando para picos de alto volume de 16.000 solicitações de mais de 4.000 usuários em 24 e 25 de julho.
  • Atividade relacionada a padrões de prompt foi identificada em um cluster de mais de 15.000 usuários, totalmente interrompido até 28 de julho.
  • Os atacantes tentaram extrair o raciocínio copiando conteúdo criptografado de uma conversa e pedindo a um modelo em outra que o descriptografasse.
  • A OpenAI mitigou a campanha por meio de aplicação de contas, controles técnicos e coordenação com o Frontier Model Forum.

A empresa alerta que a destilação adversarial representa riscos de segurança e de segurança nacional ao permitir que outros reproduzam as capacidades do modelo sem preservar as salvaguardas originais.