Vision as Unified Multimodal Generation
Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang 외
컴퓨터 비전을 통합 멀티모달 모델의 생성 태스크로 재정의하여, 태스크별 구조 없이 다양한 비전 문제를 해결하는 방법을 제안한다.
컴퓨터 비전은 태스크별로 별도의 아키텍처와 예측 헤드가 필요한 경우가 많아, 범용 파운데이션 모델에 통합하기 어렵다. 이 연구는 이 문제를 해결하기 위해 비전을 텍스트와 이미지 생성이라는 통합된 프레임워크로 재정의한다.
SenseNova-Vision은 자연어 지시문과 선택적 비주얼 프롬프트를 사용하여 태스크, 대상 영역, 디코딩 규칙을 지정한다. 텍스트로 상징적 출력을, 이미지로 밀집 공간 예측을 생성한다. 다양한 비전 어노테이션을 지시문-응답 예제로 변환하여 대규모 학습을 지원하는 SenseNova-Vision Corpus를 구축했다. 기존 멀티모달 모델을 이 코퍼스로 주로 학습시켰다.
단일 통합 모델이 구조적 비전 이해, 밀집 기하학 예측, 세그멘테이션, 다중 뷰 비전 기하학 등에서 태스크별 최첨단 시스템과 견줄 수 있음을 실험으로 보여주었다. 통합 멀티모달 생성이 범용 파운데이션 모델에 비전 역량을 통합하는 확장 가능한 경로임을 시사한다. 모델과 코퍼스를 공개했다.