LLM Post-Training: A Deep Dive into Reasoning Large Language Models
Komal Kumar, Tajamul Ashraf, Omkar Thawakar, R. Anwer, Hisham Cholakkal, Mubarak Shah, Ming-Hsuan Yang, P. Torr 외
LLM 사후 훈련(post-training) 기법을 체계적으로 정리한 서베이 논문으로, 파인튜닝, 강화학습, 테스트타임 스케일링 등 주요 방법론을 분석하고 미래 방향을 제시한다.
사전 훈련만으로는 LLM의 추론 능력, 사실 정확성, 사용자 의도 정렬 등이 충분하지 않다. 사후 훈련 과정에서 발생하는 파괴적 망각, 보상 해킹, 추론 시간과 성능 간 트레이드오프 등의 문제를 해결해야 한다.
파인튜닝, 강화학습(특히 RLHF), 테스트타임 스케일링 등 다양한 사후 훈련 전략을 분류하고 각각의 장단점을 분석한다. 또한 모델 정렬, 확장 가능한 적응, 추론 시간 추론 등 주요 연구 방향을 정리한다.
사후 훈련 방법론에 대한 포괄적인 분류 체계를 제공하고, 각 방법의 핵심 과제와 미래 연구 방향을 제시한다. 공개 저장소를 통해 지속적으로 업데이트되는 자료를 제공한다.