OpenAI mengidentifikasi dan menggagalkan kampanye distilasi adversarial terkoordinasi yang dikaitkan dengan individu-individu yang berafiliasi dengan Moonshot AI, pengembang Kimi. Para pelaku memanipulasi interaksi model untuk mengekstraksi penalaran internal yang terlindungi dari model-model OpenAI, melanggar ketentuan layanan.

  • Aktivitas dimulai pada 1 Juli, meningkat menjadi lonjakan volume tinggi sebesar 16.000 permintaan dari lebih dari 4.000 pengguna pada 24 dan 25 Juli.
  • Aktivitas pola prompt terkait diidentifikasi di sekelompok lebih dari 15.000 pengguna, yang sepenuhnya digagalkan pada 28 Juli.
  • Para penyerang mencoba mengekstraksi penalaran dengan menyalin konten terenkripsi dari satu percakapan dan meminta model di percakapan lain untuk mendekripsinya.
  • OpenAI mengurangi dampak kampanye tersebut melalui penegakan akun, kontrol teknis, dan koordinasi dengan Frontier Model Forum.

Perusahaan memperingatkan bahwa distilasi adversarial menimbulkan risiko keamanan dan keamanan nasional dengan memungkinkan pihak lain mereproduksi kemampuan model tanpa mempertahankan pengaman asli.