OpenAI выявила и пресекла скоординированную кампанию враждебного дистиллирования, приписываемую лицам, связанным с Moonshot AI, разработчиком Kimi. Операторы манипулировали взаимодействием с моделями, чтобы извлечь защищённые внутренние рассуждения из моделей OpenAI в нарушение условий использования.

  • Активность началась 1 июля, достигнув пиковых объёмов в 16 000 запросов от более чем 4 000 пользователей 24 и 25 июля.
  • Связанная активность с паттернами промптов была выявлена среди кластера из более чем 15 000 пользователей, полностью пресечённого к 28 июля.
  • Атакующие пытались извлечь рассуждения, копируя зашифрованный контент из одного разговора и запрашивая у модели в другом его расшифровку.
  • OpenAI нейтрализовала кампанию посредством блокировки учётных записей, технических мер контроля и координации с Frontier Model Forum.

Компания предупреждает, что враждебное дистиллирование создаёт риски для безопасности и национальной безопасности, позволяя другим воспроизводить возможности моделей без сохранения оригинальных защитных механизмов.