OpenAI выявила и пресекла скоординированную кампанию враждебного дистиллирования, приписываемую лицам, связанным с Moonshot AI, разработчиком Kimi. Операторы манипулировали взаимодействием с моделями, чтобы извлечь защищённые внутренние рассуждения из моделей OpenAI в нарушение условий использования.
- Активность началась 1 июля, достигнув пиковых объёмов в 16 000 запросов от более чем 4 000 пользователей 24 и 25 июля.
- Связанная активность с паттернами промптов была выявлена среди кластера из более чем 15 000 пользователей, полностью пресечённого к 28 июля.
- Атакующие пытались извлечь рассуждения, копируя зашифрованный контент из одного разговора и запрашивая у модели в другом его расшифровку.
- OpenAI нейтрализовала кампанию посредством блокировки учётных записей, технических мер контроля и координации с Frontier Model Forum.
Компания предупреждает, что враждебное дистиллирование создаёт риски для безопасности и национальной безопасности, позволяя другим воспроизводить возможности моделей без сохранения оригинальных защитных механизмов.