SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models
Xinyi Zeng, Xue Yang, Jingyuan Zhang, Huanqian Yan, Xiang Chen, Kaiwen Wei, Hankun Kang, Yu Tian
멀티모달 LLM의 디코딩 단계에서 유해성을 탐지하고 수정해 안전성을 높이는 가벼운 방어 메커니즘을 제안한다.
멀티모달 대규모 언어 모델(MLLM)은 입력 특성의 이질성 때문에 탈옥 공격에 취약하다. 기존 방어 방법은 비용이 많이 드는 파인튜닝이나 비효율적인 사후 개입에 의존하여 새로운 공격에 대응하기 어렵고 성능 트레이드오프가 발생한다.
SafeSteer는 MLLM이 디코딩 과정에서 유해성과 무해성을 구별할 수 있다는 관찰에 기반한다. 구체적으로, 디코딩 단계에서 유해 출력을 탐지하고 수정하는 가벼운 탐지기(Decoding-Probe)를 도입하여 디코딩 과정을 안전 방향으로 반복적으로 유도한다. 또한, 텍스트의 강력한 안전 정렬을 비전 모달리티로 전이하기 위해 모달리티 간 의미 정렬 벡터를 통합한다.
여러 MLLM에 대한 실험에서 SafeSteer는 파인튜닝 없이 모델의 안전성을 최대 33.40% 향상시켰다. 특히 모델의 유용성을 유지하면서 유해성과의 균형을 보장하는 효과적인 방어 메커니즘을 제시했다.