O memaudit é uma ferramenta que se integra ao SFTTrainer do Hugging Face TRL para fornecer evidências de que o ajuste fino em dados privados ou de clientes não resultou em memorização. Ele aborda a falta comum de verificação dos requisitos legais e de segurança, incorporando segredos decoy calibrados diretamente no conjunto de dados de treinamento.

  • A ferramenta usa uma função inject() para plantar os decoys e um MemorizationAuditCallback para monitorá-los durante o treinamento.
  • Ele verifica se cada decoy recebe perda sob a configuração específica, incluindo mascaramento, empacotamento, LoRA/QLoRA e modelos de chat, falhando na execução se a verificação falhar.
  • O relatório JSON final responde a duas perguntas distintas: inferência de associação (um atacante pode identificar registros treinados) e regurgitação (o modelo completa os prefixos do treinamento).
  • Uma execução de prova pública no TinyLlama-1.1B-Chat com 20k dados Alpaca mostrou uma curva de vazamento onde a duplicação se correlacionou com a exposição, enquanto a regurgitação foi zero sob protocolos de correspondência exata.
  • A saída é versionada, inclui checksums, mapeia para a Opinião EDPB 28/2024 e não contém chamadas externas.

Isso permite que as equipes gerem relatórios verificáveis e locais que podem ser encaminhados a reguladores ou clientes para provar a conformidade com a privacidade de dados, sem depender de falhas silenciosas de testes ingênuos.