memaudit — это инструмент, который интегрируется в SFTTrainer от Hugging Face TRL для предоставления доказательств того, что дообучение на приватных или клиентских данных не привело к запоминанию. Он решает распространённую проблему отсутствия проверки юридических и безопасностных требований путём внедрения калиброванных ложных секретов непосредственно в обучающий набор данных.
- Инструмент использует функцию inject() для размещения ложных секретов и MemorizationAuditCallback для их мониторинга во время обучения.
- Он проверяет, что каждый ложный секрет получает потерю при конкретной конфигурации, включая маскирование, упаковку, LoRA/QLoRA и шаблоны чата; если проверка не проходит, запуск завершается ошибкой.
- Итоговый JSON-отчёт отвечает на два отдельных вопроса: вывод о принадлежности (может ли злоумышленник идентифицировать обученные записи) и воспроизведение (дополняет ли модель префиксы обучающих данных).
- Публичный тестовый запуск на TinyLlama-1.1B-Chat с 20k данными Alpaca показал кривую утечки, где дублирование коррелировало с экспозицией, а воспроизведение было нулевым при протоколах точного совпадения.
- Вывод версионирован, содержит контрольные суммы, сопоставляется с Мнением EDPB 28/2024 и не содержит внешних вызовов.
Это позволяет командам генерировать проверяемые локальные отчёты, которые можно передавать регуляторам или клиентам для подтверждения соответствия конфиденциальности данных без reliance на скрытые сбои наивных тестов.