memaudit — это инструмент, который интегрируется в SFTTrainer от Hugging Face TRL для предоставления доказательств того, что дообучение на приватных или клиентских данных не привело к запоминанию. Он решает распространённую проблему отсутствия проверки юридических и безопасностных требований путём внедрения калиброванных ложных секретов непосредственно в обучающий набор данных.

  • Инструмент использует функцию inject() для размещения ложных секретов и MemorizationAuditCallback для их мониторинга во время обучения.
  • Он проверяет, что каждый ложный секрет получает потерю при конкретной конфигурации, включая маскирование, упаковку, LoRA/QLoRA и шаблоны чата; если проверка не проходит, запуск завершается ошибкой.
  • Итоговый JSON-отчёт отвечает на два отдельных вопроса: вывод о принадлежности (может ли злоумышленник идентифицировать обученные записи) и воспроизведение (дополняет ли модель префиксы обучающих данных).
  • Публичный тестовый запуск на TinyLlama-1.1B-Chat с 20k данными Alpaca показал кривую утечки, где дублирование коррелировало с экспозицией, а воспроизведение было нулевым при протоколах точного совпадения.
  • Вывод версионирован, содержит контрольные суммы, сопоставляется с Мнением EDPB 28/2024 и не содержит внешних вызовов.

Это позволяет командам генерировать проверяемые локальные отчёты, которые можно передавать регуляторам или клиентам для подтверждения соответствия конфиденциальности данных без reliance на скрытые сбои наивных тестов.