한줄 요약
Megatron과 SGLang을 연결하여 대규모 강화학습 기반 LLM 후처리를 수행하는 프레임워크이다.
핵심 기능
고성능 학습: Megatron과 SGLang을 연결하여 다양한 모드에서 효율적인 학습을 지원한다.
유연한 데이터 생성: 커스텀 데이터 생성 인터페이스와 서버 기반 엔진을 통해 임의의 학습 데이터 생성 워크플로우를 가능하게 한다.
네이티브 엔진 패스스루: Megatron과 SGLang의 제어 인터페이스를 상위 엔진에 가깝게 유지하며, RL 데이터 흐름을 추가한다.
프로덕션 검증: GLM 시리즈, Qwen 시리즈, DeepSeek V3 시리즈 등 대규모 모델의 완전한 후처리 워크플로우를 통해 검증되었다.
언제 쓰나
대규모 언어 모델의 강화학습 기반 후처리(예: RLHF, RLAIF)를 수행할 때, 고성능 학습과 유연한 데이터 생성이 통합된 프레임워크가 필요할 때 사용한다.