OpenAI a identifié et perturbé une campagne coordonnée de distillation adversariale attribuée à des individus associés à Moonshot AI, le développeur de Kimi. Les opérateurs ont manipulé les interactions avec le modèle pour extraire des raisonnements internes protégés des modèles OpenAI, en violation des conditions d'utilisation.
- L'activité a débuté le 1er juillet, s'intensifiant avec des pics de volume atteignant 16 000 requêtes provenant de plus de 4 000 utilisateurs les 24 et 25 juillet.
- Une activité liée à des motifs d'invite a été identifiée au sein d'un groupe de plus de 15 000 utilisateurs, entièrement perturbée d'ici le 28 juillet.
- Les attaquants ont tenté d'extraire du raisonnement en copiant du contenu chiffré depuis une conversation et en demandant à un modèle dans une autre de le déchiffrer.
- OpenAI a atténué la campagne par des mesures de restriction de comptes, des contrôles techniques et une coordination avec le Frontier Model Forum.
L'entreprise met en garde contre les risques pour la sécurité et la sûreté nationale posés par la distillation adversariale, qui permet à d'autres de reproduire les capacités du modèle sans préserver les protections initiales.