Deployment-Aware Compression of Large Language Models for Edge Intelligence: A System-Level Survey
Elias Dritsas, M. Trigka
엣지 디바이스에서의 대규모 언어 모델 배포를 위한 압축 기법과 시스템 수준 고려사항을 체계적으로 분류하고 분석하는 서베이 연구이다.
대규모 언어 모델을 엣지 하드웨어에 배포할 때, 모델 압축 알고리즘과 실제 하드웨어/컴파일러 툴체인 간의 상호작용을 명확히 이해하고 체계적으로 정리하는 것이 필요하다. 또한 기존 벤치마크가 실제 배포 시 중요한 로버스트니스, 수치 정밀도, 컴파일러 유발 지연 시간 등을 충분히 평가하지 못하는 한계가 있다.
양자화, 가지치기, 증류 등 주요 압축 전략을 배포 중심 관점에서 분류하고, 텐서 가상 머신, 코어 머신 러닝, 텐서 런타임-LLM 등 다양한 컴파일러와의 상호작용을 분석한다. 실제 배포 스택을 대상으로 한 사례 연구를 통해 시스템 수준 제약이 실제 병목 현상으로 어떻게 전환되는지 보여준다.
배포 중심 분류 체계를 제시하고, 컴파일러 유발 지연 시간 및 에너지 변동성, 수치 정밀도 추적 등 기존 벤치마크의 한계를 명확히 지적한다. 엣지에서의 지속적 모델 적응, 프라이버시 보호 개인화, 시스템 제약 하 안전하고 재현 가능한 배포 등 향후 과제를 식별하여 실무자, 컴파일러 엔지니어, 하드웨어 벤더에게 구조화된 지침을 제공한다.