한줄 요약
단일 이미지 3D 생성기를 확장하여, 프롬프트 기반 장면 이미지로부터 세밀한 제어가 가능한 대규모 3D 장면을 합성하는 프레임워크를 제안합니다.
풀어야 하는 문제
기존 이미지-3D 생성기는 단일 에셋 생성에는 우수하지만, 여러 객체와 복잡한 공간 관계를 포함하는 전체 장면의 3D 합성으로 확장하기 어렵습니다. 또한, 장면 수준의 3D 훈련 데이터가 부족하여 모델을 직접 훈련하거나 미세 조정하는 데 큰 장애물이 됩니다.
접근 방법
합성 데이터 엔진: 장면 수준의 3D 데이터 부족 문제를 해결하기 위해, 다양한 3D 에셋을 조합하여 장면 레이아웃을 자동으로 생성하는 새로운 합성 데이터 엔진을 제안합니다.
합성 연산자로의 적응: 기존 이미지-3D 생성기를 합성 장면 데이터로 미세 조정하여, 전체 장면의 다이메트릭 이미지를 입력으로 받아 해당 영역의 3D 구조를 생성하는 합성 연산자(convolutional operator)로 만듭니다.
장면 합성 파이프라인: 사용자 프롬프트로부터 전체 장면의 다이메트릭 이미지를 생성하고, 이를 합성 연산자에 적용하여 임의 크기와 복잡도를 가진 3D 장면을 최종적으로 합성합니다.
결과·기여
다양한 프롬프트와 레이아웃에 대해, 기존 접근 방식의 한계를 극복하고 크고 일관성 있으며 세밀한 3D 장면을 성공적으로 생성합니다.
장면 수준 3D 데이터의 부족이라는 핵심 문제를 해결하기 위한 새로운 합성 데이터 엔진을 제안하여, 향후 관련 연구에 기여할 수 있는 데이터 생성 방법론을 제공합니다.
단일 에셋 생성기를 장면 스케일로 확장하는 실용적인 방법론을 제시하여, 3D 콘텐츠 생성의 자동화와 확장성 향상에 기여합니다.