MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation
Jiaju Han, Ma Yaqi, Yahui Chai, Xuemeng Sun, Xin Li, Qike Zhang, Yingying Zhao, Xiang Chen 외
적외선 원격탐사 영상의 비전-언어 학습을 위한 데이터셋, 벤치마크 및 적응 방법을 제안한다.
기존 원격탐사 비전-언어 모델과 데이터셋은 주로 가시광선 영상에 초점을 맞추고 있어, 조명 변화에 강건한 적외선 영상의 특수한 구조와 대비를 이해하는 데 한계가 있다.
동일한 소스 풀에서 60만 장의 합성 적외선 영상과 59,032개의 적외선 인식 캡션을 구축하여 MonoIR-RS 데이터셋을 만들었다. 이 데이터셋을 이용해 CLIP 백본 5개와 VLM 백본 6개를 적외선 영상에 맞게 미세조하고 제로샷 성능과 비교 평가했다.
합성 적외선 영상이 회색조 변환보다 실제 열화상에 더 가까움을 입증했다. 적외선 인식 적응을 통해 CLIP의 평균 리콜이 최대 12.8점 향상되었고, VLM 캡셔닝에서 적외선 단서 커버리지가 100%에 도달하면서 RGB 색상 누출이 거의 제로가 되었다. 적외선 단일 모달리티에 집중함으로써 재현 가능한 테스트베드를 제공한다.