Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
Qinwu Xu, Yifan Jiang, Haoyu Ren
OCR과 다국어 텍스트 이해를 개선하기 위해 합성 데이터, OCR 인식 미세조정, 시각적 사고사슬 프롬프팅을 결합한 멀티모달 LLM 훈련 프레임워크.
멀티모달 LLM은 실제 이미지에서 작은 글씨, 흐림, 가려짐, 복잡한 타이포그래피 등이 포함된 OCR 및 다국어 텍스트 이해에 취약함.
1) 대규모 합성 OCR-번역 데이터 생성, 2) LoRA를 이용한 OCR 인식 지도 미세조정, 3) 불확실한 시각 조건에서 추론을 위한 구조화된 시각적 사고사슬 프롬프팅.
다국어 영수증, 메뉴, 포스터, 간판, 필기체, 문서 이미지에서 기준 모델 대비 시각-텍스트 정렬이 크게 개선됨. GPT-5급 및 Gemini 계열 모델과의 정성적 비교에서도 OCR 정확도 향상 및 환각 감소 확인.