Natural Identifiers for Privacy and Data Audits in Large Language Models
Lorenzo Rossi, Bartlomiej Marek, Franziska Boenisch, Adam Dziedzic
LLM 프라이버시 감사의 현실적 장벽을 해결하기 위해, 학습 데이터에 이미 존재하는 자연 식별자(NID)를 활용하는 새로운 감사 프레임워크를 제안합니다.
기존 차등 프라이버시 감사 방법은 감사용 캐너리를 학습에 삽입해야 하므로, 이미 학습된 모델을 감사하려면 비용이 많이 드는 재학습이 필요합니다. 또한, 데이터셋 추론은 IID 분포의 비공개 비멤버 데이터셋을 필요로 하는데, 실제 상황에서는 이를 구하기 어렵습니다.
학습 데이터셋에 자연스럽게 존재하는 구조화된 무작위 문자열(암호학적 해시, 단축 URL 등)을 '자연 식별자(NID)'로 정의합니다. NID의 형식을 이용해 동일 분포의 무한한 추가 문자열을 생성할 수 있으며, 이를 감사용 대체 캐너리 및 데이터셋 추론용 동일 분포 보유 데이터로 활용합니다.
NID를 사용하면 재학습 없이 사후 차등 프라이버시 감사가 가능함을 입증했습니다. 또한, NID를 포함한 모든 의심 데이터셋에 대해 비공개 비멤버 보유 데이터셋 없이도 데이터셋 추론을 수행할 수 있게 되어, 확장 가능하고 사후적인 감사의 가능성을 열었습니다.