memaudit는 Hugging Face TRL의 SFTTrainer에 통합되어 개인 또는 고객 데이터에 대한 파인튜닝이 암기를 초래하지 않았음을 입증하는 증거를 제공하는 도구입니다. 이는 calibrated decoy secrets를 학습 데이터셋에 직접 삽입하여 법적 및 보안 요구사항에 대한 검증 부족이라는 일반적인 문제를 해결합니다.
- 이 도구는 decoy를 심는 inject() 함수와 학습 중 이를 모니터링하는 MemorizationAuditCallback을 사용합니다.
- 마스킹, 패킹, LoRA/QLoRA, 채팅 템플릿을 포함한 특정 구성 하에서 모든 decoy가 손실을 받는지 검증하며, 검증이 실패하면 실행을 중단합니다.
- 최종 JSON 보고서는 두 가지 명확한 질문에 답합니다: 멤버십 추론(공격자가 학습된 레코드를 식별할 수 있는가)과 재생산(모델이 학습 접두사를 완성하는가).
- 20k Alpaca 데이터로 TinyLlama-1.1B-Chat에서 수행한 공개 증명 실행은 노출과 중복이 상관관계 있는 누출 곡선을 보였으며, 정확 일치 프로토콜 하에서는 재생산이 제로였습니다.
- 출력물은 버전 관리되며 체크섬을 포함하고 EDPB Opinion 28/2024에 매핑되며 외부 호출을 포함하지 않습니다.
이를 통해 팀은_naive_ 테스트의 침묵하는 실패에 의존하지 않고 규제 기관이나 고객에게 전달하여 데이터 프라이버시 준수성을 입증할 수 있는 검증 가능한 로컬 보고서를 생성할 수 있습니다.