memaudit 是一个与 TRL 库集成的工具,用于验证在私有数据上微调模型是否导致了记忆化。它通过将校准的诱饵秘密注入数据集并监控训练过程中的损失来工作。
- 使用 `inject()` 植入诱饵,并使用 `MemorizationAuditCallback` 在 SFTTrainer 工作流程内处理审计。
- 在训练开始时验证每个诱饵在实际配置(包括掩码、打包和 LoRA 设置)下是否都获得了损失值。
- 如果某个哨兵从未获得损失值,则运行失败,以防止虚假的“无风险”报告。
- 生成一份本地 JSON 报告,涵盖包含置信区间的成员推断和复述测试。
- 包含在 TinyLlama-1.1B-Chat 上的公开演示运行,显示泄露与数据重复相关。
该工具为涉及数据隐私的法律或安全调查提供测试证据,而非作为合规证书。