OpenAI identificó e interrumpió una campaña coordinada de destilación adversarial atribuida a individuos asociados con Moonshot AI, el desarrollador de Kimi. Los operadores manipularon las interacciones del modelo para extraer el razonamiento interno protegido de los modelos de OpenAI en violación de los términos de servicio.
- La actividad comenzó el 1 de julio, escalando a picos de alto volumen de 16.000 solicitudes de más de 4.000 usuarios los días 24 y 25 de julio.
- Se identificó actividad relacionada con patrones de prompts en un grupo de más de 15.000 usuarios, completamente interrumpida para el 28 de julio.
- Los atacantes intentaron extraer razonamiento copiando contenido cifrado de una conversación y pidiendo a un modelo en otra que lo descifrase.
- OpenAI mitigó la campaña mediante aplicación de cuentas, controles técnicos y coordinación con el Frontier Model Forum.
La empresa advierte que la destilación adversarial plantea riesgos de seguridad y de seguridad nacional al permitir que otros reproduzcan las capacidades del modelo sin preservar las salvaguardas originales.