memaudit est un outil qui s'intègre au SFTTrainer de Hugging Face TRL pour fournir la preuve que le fine-tuning sur des données privées ou clients n'a pas entraîné de mémorisation. Il comble le manque courant de vérification des exigences légales et de sécurité en intégrant directement dans l'ensemble d'entraînement des secrets decoy calibrés.

  • L'outil utilise une fonction inject() pour planter des leurres et un MemorizationAuditCallback pour les surveiller pendant l'entraînement.
  • Il vérifie que chaque leurre subit une perte sous la configuration spécifique, incluant le masquage, le packing, LoRA/QLoRA et les templates de chat, échouant l'exécution si la vérification échoue.
  • Le rapport JSON final répond à deux questions distinctes : l'inférence d'appartenance (un attaquant peut-il identifier les enregistrements entraînés) et la régurgitation (le modèle complète-t-il les préfixes d'entraînement).
  • Un run de preuve public sur TinyLlama-1.1B-Chat avec 20k données Alpaca a montré une courbe de fuite où la duplication corrélait avec l'exposition, tandis que la régurgitation était nulle sous les protocoles de correspondance exacte.
  • La sortie est versionnée, inclut des checksums, se mappe à l'Opinion 28/2024 de l'EDPB et ne contient aucun appel externe.

Cela permet aux équipes de générer des rapports locaux vérifiables qui peuvent être transmis aux régulateurs ou aux clients pour prouver la conformité à la confidentialité des données sans dépendre des échecs silencieux des tests naïfs.