CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents
Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang, Yuxiao Dong
컨텍스트 압축을 강화학습에 통합해 긴 에이전트 작업의 성능을 향상시키는 CompactionRL 전략을 제안한다.
긴 에이전트 작업은 상호작용 트래젝터리가 길어져 작업 완료 전에 최대 컨텍스트 길이를 초과할 수 있다. 이는 기존의 긴 컨텍스트 기반 강화학습 접근 방식의 주요 제약 조건이다.
CompactionRL은 이전 상호작용 상태를 요약하는 컨텍스트 압축을 강화학습에 결합한다. 작업 실행과 요약 생성을 동시에 최적화하기 위해 토큰 수준 손실 정규화와 트래젝터리 간 일반화된 이점 추정(GAE)을 사용한다.
CompactionRL은 오픈 모델(GLM-4.5-Air, GLM-4.7-Flash)을 기반으로 에이전트 코딩 작업에서 일관된 성능 향상을 보여주었다. 특히 SWE-bench Verified와 Terminal-Bench 2.0에서 상당한 Pass@1 점수 향상을 달성했으며, GLM-5.2 모델의 RL 파이프라인에도 통합되었다.