Benchmarking Empirical Privacy Protection for Adaptations of Large Language Models
Bartlomiej Marek, Lorenzo Rossi, Vincent Hanke, Xun Wang, M. Backes, Franziska Boenisch, Adam Dziedzic
대규모 언어 모델 적응 시 차별적 프라이버시(DP)의 이론적 보장이 실제로 얼마나 작동하는지를 공격 기법으로 검증하는 벤치마크 연구입니다.
최근 민감한 응용을 위해 LLM을 적응시킬 때 DP가 적용되고 있으나, LLM의 사전 학습 데이터와 적응 데이터 간의 중복 및 상호 의존성으로 인해 이론적 보장이 실제 프라이버시 보호로 이어지지 않을 수 있습니다. 따라서 DP 적용 시 실질적 프라이버시 위험이 어떻게 변하는지 체계적인 분석이 필요합니다.
연구진은 강건한 멤버십 추론 공격과 카나리 데이터 추출 공격과 같은 최신 공격 기법을 사용하여 프라이버시 위험을 측정했습니다. 적응 데이터의 분포를 사전 학습 데이터와의 정확한 중복, 분포 내(IID), 완전히 분포 밖(OOD)의 경우로 체계적으로 변형하여 분석했습니다. 또한 다양한 적응 방법(예: LoRA)과 다양한 프라이버시 체제가 취약성에 미치는 영향을 평가했습니다.
결과적으로 분포 이동이 프라이버시 취약성에 강한 영향을 미치며, 동일한 이론적 보장 하에서 적응 데이터가 사전 학습 분포에 가까울수록 실질적 프라이버시 위험이 높아지는 것으로 나타났습니다. 특히 OOD 데이터에 대해서는 LoRA와 같은 매개변수 효율적 미세 조정 방법이 가장 높은 실질적 프라이버시 보호를 달성했습니다. 본 연구는 민감한 환경에서 맞춤형 모델을 배포하기 위한 실용적인 통찰을 제공하는 프라이버시 벤치마크를 확립했습니다.