Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs
Junhao Shi, Siyin Wang, Xiaopeng Yu, Li Ji, Jingjing Gong, Xipeng Qiu
태스크 무관 사전 학습(TAP)은 저렴한 비지도 데이터로 로봇의 이동 능력을 먼저 학습한 후, 소량의 전문가 데이터로 언어를 정렬하여 데이터 효율성과 강인성을 크게 높이는 VLA 학습 프레임워크이다.
비전-언어-행동(VLA) 모델은 관찰, 지시, 행동의 삼중항 전문가 시연 데이터를 대규모로 수집해야 하는 비용과 어려움 때문에 발전이 제한되어 있다. 기존 방법은 '어떻게 움직일 것인가(물리적 역량)'와 '무엇을 할 것인가(언어 정렬)'라는 두 가지 학습 목표를 혼동하여 데이터 비효율을 초래한다.
본 연구는 '분해 가설'을 기반으로 두 가지 학습 목표를 명확히 분리한다. 1단계에서는 태스크와 무관하게 수집 가능한 저렴한 비지도 상호작용 데이터(오프태스크 트래젝터리, 자율 플레이 등)를 이용해 자기 지도 역동학 목표로 이동 능력의 사전 학습을 수행한다. 2단계에서는 소량의 전문가 데이터를 사용하여 언어로 사전 학습된 이동 능력을 정렬한다.
SIMPLER 벤치마크에서 TAP는 100만 개 이상의 전문가 트래젝터리로 훈련된 모델과 동등한 성능을 내면서도 훨씬 적은 레이블 데이터를 사용하여 표준 행동 클로닝 대비 10%의 절대적 성능 향상을 달성했다. 실제 WidowX 로봇 플랫폼에서는 카메라 왜곡이 가해진 환경에서 기존 모델들이 0%로 붕괴할 때 TAP가 25%의 성공률을 유지하여, 태스크 무관 사전 학습이 강인하고 전이 가능한 물리적 표현을 생성함을 입증했다.