memaudit 是一个集成到 Hugging Face TRL 的 SFTTrainer 中的工具,用于提供证据,证明对私有或客户数据进行微调并未导致记忆性泄露。它通过将校准过的诱饵密钥直接嵌入训练数据集,解决了法律和安全要求缺乏验证的常见问题。
- 该工具使用 inject() 函数植入诱饵,并使用 MemorizationAuditCallback 在训练期间监控它们。
- 它验证每个诱饵在特定配置(包括掩码、打包、LoRA/QLoRA 和聊天模板)下是否都产生了损失;如果验证失败,则终止运行。
- 最终的 JSON 报告回答了两个独立的问题:成员推断(攻击者能否识别训练记录)和复述(模型是否会补全训练前缀)。
- 在 TinyLlama-1.1B-Chat 上使用 20k Alpaca 数据的公开证明运行显示,重复率与曝光度相关,而在精确匹配协议下复述率为零。
- 输出结果具有版本控制、包含校验和、映射到 EDPB Opinion 28/2024,且不包含任何外部调用。
这使得团队能够生成可验证的本地报告,这些报告可以转发给监管机构或客户,以证明数据隐私合规性,而无需依赖朴素测试中的静默失败。