memaudit es una herramienta que se integra en el SFTTrainer de Hugging Face TRL para proporcionar evidencia de que el ajuste fino con datos privados o de clientes no resultó en memorización. Aborda la falta común de verificación de requisitos legales y de seguridad al incrustar secretos decoy calibrados directamente en el conjunto de datos de entrenamiento.
- La herramienta utiliza una función inject() para plantar decoys y un MemorizationAuditCallback para monitorearlos durante el entrenamiento.
- Verifica que cada decoy reciba pérdida bajo la configuración específica, incluyendo enmascaramiento, empaquetado, LoRA/QLoRA y plantillas de chat, fallando la ejecución si la verificación falla.
- El informe JSON final responde a dos preguntas distintas: inferencia de membresía (puede un atacante identificar registros entrenados) y regurgitación (¿completa el modelo los prefijos de entrenamiento?).
- Una ejecución pública de prueba en TinyLlama-1.1B-Chat con 20k datos de Alpaca mostró una curva de filtración donde la duplicación se correlacionaba con la exposición, mientras que la regurgitación fue cero bajo protocolos de coincidencia exacta.
- La salida está versionada, incluye sumas de comprobación, se mapea a la Opinión 28/2024 del EDPB y no contiene llamadas externas.
Esto permite a los equipos generar informes verificables y locales que pueden enviarse a reguladores o clientes para demostrar el cumplimiento de la privacidad de datos sin depender de fallos silenciosos de pruebas ingenuas.