memaudit es una herramienta que se integra con la biblioteca TRL para verificar si el ajuste fino de modelos con datos privados ha provocado memorización. Funciona inyectando secretos señuelo calibrados en el conjunto de datos y monitoreando la pérdida durante el proceso de entrenamiento.

  • Utiliza `inject()` para sembrar los señuelos y `MemorizationAuditCallback` para gestionar la auditoría dentro del flujo de trabajo de SFTTrainer.
  • Verifica al inicio del entrenamiento que cada señuelo reciba una pérdida bajo la configuración real, incluyendo enmascaramiento, empaquetado y configuraciones de LoRA.
  • Falla la ejecución si un canario nunca recibe pérdida, evitando informes falsos de "todo claro".
  • Genera un informe JSON local que cubre pruebas de inferencia de membresía y regurgitación con intervalos de confianza.
  • Incluye una ejecución de prueba pública en TinyLlama-1.1B-Chat que muestra que la filtración se correlaciona con la duplicación de datos.

La herramienta proporciona evidencia de prueba para consultas legales o de seguridad sobre privacidad de datos, en lugar de servir como certificado de cumplimiento.