Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation
Jiaming Liu, Qingpo Wuwu, Nuowei Han, Hao Chen, Zhuoyang Liu, Fan Fei, Yueru Jia, Chenyang Gu 외
로봇 조작을 위해 3D 기하학과 동적 물리 이해를 통합한 새로운 VLA 프레임워크를 제안한다.
기존 VLA 모델은 3D 정보 활용에 제한이 있고, 기하학적 정보 손실과 동적 환경에서의 시간적 행동 모델링 부족으로 효과적인 로봇 조작에 어려움이 있다.
기존 Lift3D 모델을 확장하여 3D 포인트 클라우드를 VLA 비전 인코더에 직접 인코딩하고, 기하 중심 마스킹 자동 인코딩(GC-MAE)을 통해 3D 구조와 물리적 역학을 동시에 학습한다. 또한 LLM의 여러 레이어를 활용한 시간적 행동 모델링으로 일관된 행동 청크를 예측한다.
MetaWorld와 RLBench에서 기존 최고 성능 VLA 대비 각각 10.8%, 11.1% 높은 평균 성공률을 달성했으며, 실제 환경에서도 4%p 성능 향상을 보여 3D 인식 기반 로봇 조작의 새로운 기준을 제시한다.