MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim
4D 기하학 브릿지를 활용해 단일 확산 모델에서 길이와 뷰 수에 제한 없는 기하학적으로 일관된 다중 뷰 동영상을 생성하는 프레임워크를 제안한다.
최근 비디오 확산 모델은 긴 단일 뷰 생성 또는 짧은 다중 뷰 합성은 가능하지만, 동적 장면에 대한 길고 다중 뷰 일관적인 동영상을 생성하는 것은 여전히 해결되지 않은 문제이다.
완성된 소스 뷰의 3D 구조를 재구성하고 다음 타겟 뷰포인트의 기하학적 프라이어를 렌더링하여 확산 모델이 고품질 비디오로 정제하도록 하는 4D 기하학 브릿지를 도입한다. 또한, 학습 시 두 뷰 슬롯을 노이즈로 초기화하는 결합 디노이징 체계를 도입하여 시간적으로 무제한 생성을 가능하게 한다. Distribution Matching Distillation과 Spatio-Temporal Self-Forcing를 통해 모델을 증류하여 학습-추론 간 노출 편향 차이를 해소한다.
합성 및 실제 데이터에 대한 광범위한 실험을 통해, MV-Forcing이 단일 few-step 학생 모델을 사용하여 임의의 길이와 뷰포인트 수를 가진 동적 장면의 기하학적으로 일관된 다중 뷰 동영상을 생성함을 입증한다.