SODA: Semi On-Policy Black-Box Distillation for Large Language Models
Xiwen Chen, Jingjing Wang, Wenhui Zhu, Peijie Qiu, Xuanzhao Dong, Hejian Sang, Zhipeng Wang, A. Geramifard 외
SODA는 학생 모델의 정적 출력과 교사 모델의 최적 응답을 대비하는 반온정책 블랙박스 증류 방법으로, 기존 온정책 방식의 불안정성과 계산 비용을 크게 줄이면서도 우수한 성능을 달성한다.
블랙박스 LLM 증류에서 오프정책 방식(예: sequence-level KD)은 학생의 고유 오류를 교정하기 어렵고, 완전 온정책 방식(예: GAD)은 적대적 훈련으로 인한 불안정성과 막대한 계산 오버헤드가 문제였다.
소형 학생 모델의 제로샷 응답이 교사 모델의 응답보다 거의 항상 열등하다는 점을 이용하여, 교사 최적 응답과 학생의 정적 스냅샷(한 번 생성된 출력)을 쌍으로 구성해 대비 신호를 만든다. 이로 인해 동적 롤아웃이나 적대적 균형 조정 없이도 고품질 분포 정렬이 가능하다.
Qwen2.5 및 Llama-3 기반 4개 소형 모델 실험에서 16개 벤치마크 중 15개에서 최신 방법과 동등하거나 더 나은 성능을 보였다. 훈련 속도는 10배 빠르고, 최대 GPU 메모리 사용량은 27% 감소했으며, 적대적 불안정성이 완전히 제거되었다.