Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model
Zizhao Yuan, Zhengtu Liang, Taowen Wang, Qiwei Liang, Yichi Wang, Yunheng Wang, Yuetong Fang, Lusong Li 외
고도 자유도 로봇 제어를 위해 액션을 구조적으로 조건화하고 의미 기반 사전 지식을 통합한 월드모델을 제안한다.
기존 액션 조건부 월드모델은 전체 액션 시퀀즈를 단일 표현으로 압축하는 방식을 사용하는데, 이는 저도 제어에는 효과적이지만 고도 자유도의 섬세하고 복잡한 로봇 동작을 모델링하기에 부적절하다. 액션 컴포넌트 간 최적화 불균형이 발생하여 미세한 효과 모델링과 액션 충실도에 문제가 있다.
액션 조건화를 전역 압축이 아닌 구조화된 프로세스로 재정의한다. 액션 토큰화를 통해 차원 수준의 의미를 보존하고, 국소 정련 및 전역 조절을 통해 액션 신호와 시각적 역학을 정렬한다. 또한, 풍부한 객체-장면 사전 지식을 제공하는 의미 분기를 도입하여 월드모델이 동적 시각 세부 사항을 포착하도록 한다.
EgoDex 및 EgoVerse 데이터셋에서의 실험을 통해, 의미 분기와 구조화된 액션 조건화의 결합이 FID, FVD, PCK 지표를 크게 개선함을 보여준다. 시각적 시간적 현실성과 액션 따르기 일관성이 향상되었으며, 제안된 구조화된 액션 조건화 설계가 다른 백본에도 확장 가능함을 검증하여 고도 자유도 제어를 위한 월드모델 스케일링의 새로운 방향을 제시한다.