d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
Siyan Zhao, Devaansh Gupta, Qinqing Zheng, Aditya Grover
확산 기반 LLM에 강화학습을 적용하여 추론 능력을 확장한 첫 연구로, 마스크 SFT와 diffu-GRPO 알고리즘을 통해 성능을 크게 향상시켰다.
기존 확산 기반 LLM(dLLM)은 언어 모델링 성능은 좋지만, AR 모델처럼 강화학습을 통한 추론 능력 향상이 가능한지 불분명했다. 본 연구는 dLLM이 RL 기반 추론 훈련을 통해 이점을 얻을 수 있는지 탐구한다.
사전 훈련된 마스크 dLLM을 SFT와 RL로 파인튜닝하는 d1 프레임워크를 제안한다. (a) 마스크 SFT를 통해 기존 데이터셋에서 지식 증류 및 자기 개선 행동 주입, (b) 정책 경사 기반의 critic-free RL 알고리즘 diffu-GRPO를 최초로 마스크 dLLM에 통합한다.
여러 수학 및 계획 벤치마크에서 최첨단 dLLM 대비 큰 성능 향상을 보였다. dLLM에 RL 기반 추론 훈련을 성공적으로 적용한 첫 사례로, 비자기회귀 생성 패러다임의 추론 능력 확장 가능성을 열었다.