Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents
Changdae Oh, Wendi Li, Seongheon Park, Samuel Yeh, Tanwi Mallick, Sharon Li
강화학습 후처리 과정에서 자동으로 생성되는 '진행 이점(progress advantage)' 신호를 이용해, 별도의 보상 모델 없이도 에이전트의 단계별 성능을 평가하고 개선할 수 있다.
에이전트 설정에서 프로세스 보상 모델을 구축하는 것은 매우 어렵다. 긴 시간축의 상호작용, 되돌릴 수 없는 행동, 그리고 확률적인 환경 피드백 때문에 인간 주석이나 몬테카를오 추정을 대규모로 수행하는 것이 사실상 불가능하다.
일반적인 확률 마르코프 결정 과정(MDP) 하에서 '진행 이점(progress advantage)'이라는 은닉 이점을 도출한다. 이는 RL 훈련된 정책과 기준 정책 간의 로그 확률 비율로, 최적 이점 함수를 정확히 복원한다. 이 신호는 주석이 필요 없고, 도메인에 구애받지 않으며, 표준 RL 후처리 파이프라인의 부산물로 얻을 수 있다.
테스트 시점 스케일링, 불확실성 정량화, 실패 귀인 등 세 가지 응용 분야와 다섯 가지 벤치마크, 네 가지 모델 계열에 걸쳐 효과를 검증했다. 모든 설정에서 신뢰도 기반 기준선을 일관되게 능가했으며, 특정 작업에 대한 훈련이 필요 없음에도 불구하고, 별도로 훈련된 보상 모델을 능가하는 성능을 보였다.