From System 1 to System 2: A Survey of Reasoning Large Language Models
Zhong-Zhi Li, Duzhen Zhang, Ming-Liang Zhang, Jiaxin Zhang, Zengyan Liu, Yuxuan Yao, Haotian Xu, Junhao Zheng 외
이 논문은 직관적 사고(System 1)에서 논리적 사고(System 2)로의 전환을 목표로 하는 추론 LLM의 발전을 종합적으로 조사한 서베이 논문이다.
기존 LLM은 빠른 의사결정(System 1)에는 뛰어나지만, 복잡한 추론이 필요한 문제에서 단계적 논리적 사고(System 2)를 제대로 수행하지 못한다. 이로 인해 수학, 코딩, 과학적 추론 등 고난도 과제에서 성능이 제한적이다.
논문은 먼저 기초 LLM의 발전과 초기 System 2 기술을 개괄하고, 추론 LLM을 구축하는 방법(예: 강화학습, 과정 기반 보상 모델, 자기 수정 등)을 체계적으로 정리한다. 또한 다양한 추론 모델의 진화 과정과 핵심 방법론을 분석하고, 주요 벤치마크에서의 성능 비교를 제공한다.
이 서베이는 추론 LLM 분야의 체계적인 분류 체계를 제공하고, o1/o3, R1 등 최신 모델의 기술적 차이점을 명확히 한다. 또한 향후 연구 방향(예: 다중 양식 추론, 지속적 학습, 효율성 개선)을 제시하며, 실시간 업데이트되는 GitHub 저장소를 통해 최신 동향을 추적할 수 있도록 한다.