memaudit는 프라이빗 데이터로 모델을 파인튜닝하는 과정에서 암기가 발생했는지 확인하기 위해 TRL 라이브러리와 통합되는 도구입니다. 이 도구는 데이터셋에 보정된 미키 시크릿을 주입하고 학습 과정 중 손실을 모니터링하여 작동합니다.
- `inject()`를 사용하여 미끼를 심고, SFTTrainer 워크플로우 내에서 감사 처리를 위해 `MemorizationAuditCallback`을 사용합니다.
- 마스킹, 패킹 및 LoRA 설정을 포함한 실제 구성 하에서 모든 미키가 손실을 받는지 학습 시작 시 검증합니다.
- 카나리가 손실을 받지 않는 경우 실행을 실패시켜 잘못된 안전 보고를 방지합니다.
- 신뢰 구간이 포함된 멤버십 추론 및 재생성 테스트를 다루는 로컬 JSON 보고서를 생성합니다.
- 데이터 중복과 누출의 상관관계를 보여주는 TinyLlama-1.1B-Chat에 대한 공개 증명 실행을 포함합니다.
이 도구는 준수 증서 역할을 하기보다는 데이터 프라이버시와 관련된 법적 또는 보안 문의를 위한 테스트 증거를 제공합니다.