RoPEMover: Depth-Aware Object Relocation via Positional Embeddings
Ipek Oztas, Duygu Ceylan, Aybars Bugra Aksoy, Aysegul Dundar
扩散 모델의 RoPE 위치 임베딩을 3D 깊이 인식적으로 확장하여 이미지 내 물체를 기하학적으로 일관되게 이동시키는 방법을 제안합니다.
단일 이미지에서 물체를 이동시킬 때, 가려짐 처리, 새로운 영역 생성, 그림자와 반사의 일관성 유지 등 장면 수준의 기하학적 일관성을 유지하는 것이 기존 방법으로는 어렵습니다.
扩散 트랜스포머의 RoPE 위치 임베딩을 3D 공간 구조를 인코딩하는 깊이 인식 포뮬레이션으로 확장합니다. 이를 통해 제어된 물체 이동과 장면 인식적인 업데이트를 유도합니다. 합성 데이터와 소수의 실제 이미지를 사용한 효율적인 파인튜닝으로 모델을 학습시킵니다.
표준 물체 이동 벤치마크에서 모든 평가 지표에서 최첨단 성능을 달성했습니다. 실제 감독이 최소화된 상태에서도 큰 공간 변위 하에서 물체 특성을 보존하고, 새로 드러난 영역에 그럴듯한 내용을 생성하며, 그림자와 조명 같은 장면 의존적 효과를 일관되게 업데이트합니다.