DecompRL: Solving Harder Problems by Learning Modular Code Generation
Juliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve
기존 LLM이 풀 수 없는 어려운 코딩 문제를, 문제를 모듈로 분해하고 구현한 뒤 재조합하여 해결하는 강화학습 기반 방법을 제안한다.
대규모 언어 모델(LLM)은 반복 샘플링이나 강화학습을 통해 성능을 높일 수 있지만, 기본 정책이 정답을 생성할 확률이 거의 0에 가까운 매우 어려운 문제에는 결국 실패한다. 이는 탐색 공간이 너무 넓기 때문이다.
DecompRL은 문제를 독립적으로 풀 수 있는 하위 함수(모듈)로 분해하고, 각 모듈의 구현을 학습하는 강화학습 알고리즘을 도입한다. 학습된 모듈 구현을 재조합하여 k^n개의 후보 솔루션을 생성할 수 있게 하여, 병목을 GPU 추론에서 저렴한 CPU 평가로 이동시킨다.
LiveCodeBench와 CodeContests에서 표준 및 다양성 최적화된 RL 기반선을 크게 능가하며, 표준 생성 방식으로는 도달할 수 없는 문제들을 해결한다. GPU 토큰 비용을 약 50배 절감하는 등 효율성도 크게 향상시켰다.