A Comprehensive Survey and Guide to Multimodal Large Language Models in Vision–Language Tasks
C. Liang, Pu Tian, Caitlyn Heqi Yin, Yao Yua, An-Hou Wei, Ming Li, Xinyuan Song, Tianyang Wang 외
비전-언어 작업을 위한 멀티모달 대규모 언어 모델(MLLM)의 아키텍처, 학습, 응용 및 과제를 종합적으로 분석하고 가이드하는 서베이 논문이다.
MLLM 분야는 빠르게 발전하고 있지만, 아키텍처 설계, 학습 파이프라인, 평가 방법론, 그리고 확장성, 견고성, 추론 비용 같은 핵심 과제에 대한 체계적인 정리와 통찰이 부족했다.
이 서베이는 시각적 인코더, 언어 모델 백본, 연결 모듈 등 MLLM의 핵심 구성 요소를 분석하고, 대조적 사전 학습, 지시 조정, 선호도 정렬 등의 학습 파이프라인을 검토한다. 또한, 정보 병목 현상, 데이터 처리 한계, 통계적 동시 발생 편향 같은 근본적인 제약 조건을 조명하고, 작업별 분석과 시스템 수준의 사례 연구를 통해 주요 MLLM 구현체를 살펴본다.
MLLM 설계 공간에 대한 통합 분류 체계와 대표적인 모델 및 평가 벤치마크에 대한 비교 개요를 제시한다. 확장성, 메모리, 에너지 사용, 추론 비용, 견고성, 크로스모달 학습의 핵심 과제를 다루며, 윤리적 고려사항과 책임 있는 AI 개발을 논의하여 연구자와 실무자에게 이론적 프레임워크와 실용적인 통찰을 제공한다.