Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu
멀티모달 LLM의 장기 시각 추론을 위해 다중 에이전트 아키텍처와 공간-시간 추론 강화학습 알고리즘(ST-GRPO, J-GRPO)을 도입한 통합 프레임워크.
멀티모달 LLM은 긴 추론 체인이 필요한 복잡한 시각 추론 작업에서 성능이 부족하며, 고품질의 장기 추론 데이터와 최적화된 학습 파이프라인이 부족하다.
1) 다중 세분화 평가를 포함한 확장 가능한 데이터 생성 파이프라인을 통해 이미지 및 비디오 도메인에서 구조화된 복잡한 추론 궤적을 자동 합성한다. 2) 추론 에이전트와 요약 에이전트로 구성된 이중 에이전트 아키텍처를 설계하여 추론 과정을 분리하고, 요약 에이전트의 피드백을 활용한 반복적 자기 개선 루프를 구축한다. 3) 기존 DPO의 한계를 극복하기 위해 공간-시간 추론을 강화하는 ST-GRPO와 평가 견고성을 높이는 J-GRPO 알고리즘을 도입한다.
LLaVA-NeXT와 Qwen2.5-VL 기반 모델에서 이미지 및 비디오 추론 벤치마크에서 유의미한 성능 향상을 보였으며, 기존 인식 중심 작업에서도 강력한 성능을 유지했다.