memauditは、プライベートまたは顧客データに対するファインチューニングが記憶を引き起こしていないことを証明する証拠を提供するために、Hugging Face TRLのSFTTrainerに統合されるツールです。これは、法的およびセキュリティ要件の検証が一般的に欠如しているという問題に対処し、キャリブレーションされたデコイシークレットをトレーニングデータセットに直接埋め込みます。

  • このツールは、デコイを植え付けるinject()関数と、トレーニング中にそれらを監視するMemorizationAuditCallbackを使用します。
  • マスキング、パッキング、LoRA/QLoRA、チャットテンプレートを含む特定の構成下で、すべてのデコイが損失を受けることを検証し、検証に失敗した場合は実行を失敗させます。
  • 最終的なJSONレポートは2つの明確な問いに答えます:メンバーシップ推論(攻撃者がトレーニングされたレコードを識別できるか)と、再生(モデルがトレーニング接頭辞を完成させるか)。
  • TinyLlama-1.1B-Chatに対して20kのAlpacaデータで公開された実証ランでは、重複が露出と相関する漏洩曲線が見られましたが、厳密一致プロトコル下での再生はゼロでした。
  • 出力はバージョン管理され、チェックサムを含み、EDPB Opinion 28/2024にマッピングされ、外部呼び出しを一切含みません。

これにより、チームは検証可能なローカルレポートを生成し、単純なテストの沈黙する失敗に頼ることなく、データプライバシーコンプライアンスを証明するために規制当局や顧客に送信することができます。