GeoMix: Descriptor-Free Visual Localization via Global Context and Multi-Detector Training
Yejun Zhang, Xinjue Wang, Zihan Wang, Esa Rahtu, Juho Kannala
디스크립터 없는 시각적 위치 파악의 정확도를 크게 향상시키는 GeoMix 프레임워크를 제안합니다.
디스크립터 없는 시각적 위치 파악은 디스크립터 저장 비용과 프라이버시 문제를 해결하지만, 기존 방법들은 기하학적 구분력이 부족하여 정확도가 낮습니다. 특히 지역 기하학 단서 활용이 불완전하고, 키포인트 간 글로벌 맥락이 결여되며, 단일 탐지기에 과적합되는 문제가 있습니다.
GeoMix는 세 가지 수준에서 기하학적 구분력을 강화합니다. 1) 로컬 수준: 방향 및 거리 인식 임베딩으로 이웃 집계를 풍부하게 합니다. 2) 글로벌 수준: 학습 가능한 컨텍스트 노드와 크로스 어텐션을 통해 장면 전체 정보를 집계하고 재분배하여 모호성을 해결합니다. 3) 훈련 수준: 여러 키포인트 탐지기에서 공유 기하학 공간을 활용해 표현을 학습하는 Mix-Training을 도입합니다.
MegaDepth, Cambridge Landmarks, 7Scenes, Aachen Day-Night 데이터셋에서 디스크립터 없는 방법 중 새로운 최고 성능을 달성했습니다. 기존 최고 대비 75번째 백분위수 회전 오차를 89%, 평행 이동 오차를 최대 90% 줄였으며, 미지의 탐지기에 대해 제로샷 일반화가 가능합니다.