Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery
Seyed Hamid Reza Roodabeh, Zongyu Li, Homa Alemzadeh
비디오, 운동학, 텍스트를 결합해 로봇 수술 중 오류를 실시간으로 탐지하는 멀티모달 프레임워크를 제안한다.
로봇 보조 최소 침습 수술은 정밀도를 높이지만 복잡성이 증가하여 기술적 오류 탐지가 환자 안전에 필수적이다. 기존 비디오 기반 오류 탐지 방법은 수술 절차의 계층적 구조 내 활동과 오류 유형에 대한 세밀한 맥락 설명을 간과하고, 보완적인 멀티모달 정보를 충분히 활용하지 못한다.
비디오, 운동학 데이터, 설명적 텍스트 프롬프트를 입력으로 받는 통합 프레임워크를 설계했다. 제스처 수준 활동, 기구-객체 상호작용, 오류 정의에 대한 설명적 언어를 '활동 프롬프팅'을 통해 통합했다. 또한 수술 활동 레이블로 사전 훈련된 비전 인코더에서 파생된 '활동 인식 비전 임베딩'을 도입하여, 대조적 언어-이미지 임베딩과 기존 이미지 기반 임베딩의 효과를 비교했다.
JIGSAWS 및 SAR-RARP50 데이터셋에서 기존 최신 기법 대비 F1 점수가 각각 최대 5% 및 16.6% 향상되었다. 이는 정제된 텍스트 프롬프트와 멀티모달 데이터를 결합하는 것이 정확한 오류 탐지에 큰 가치가 있음을 입증한다.