Closing the Confidence-Faithfulness Gap in Large Language Models
Miranda Muqing Miao, Lyle Ungar
LLM의 자신감 표현과 실제 정확도 간 괴리를 메커니즘 해석을 통해 규명하고, 내부 신호를 활용한 스티어링 방법으로 교정을 개선한 연구.
LLM은 자신감 점수를 말로 표현하지만, 이 점수는 실제 정확도와 거의 무관한 경우가 많다. 이러한 '자신감-정확도 괴리'의 기하학적 원인이 무엇인지, 그리고 이를 효과적으로 줄일 방법이 필요하다.
3개의 오픈웨이트 모델과 4개 데이터셋에 대해 선형 프로브와 대비 활성화 추가(CAA) 스티어링을 사용하여 자신감 신호와 교정 신호의 표현 방식을 분석했다. 그 결과 두 신호가 선형적으로 인코딩되지만 서로 직교함을 발견했다. 또한 모델이 추론과 자신감 표현을 동시에 수행할 때 추론 과정이 자신감 신호 방향을 방해하는 '추론 오염 효과'를 확인했다. 이를 바탕으로 모델의 내부 정확도 추정치를 읽어 자신감 출력을 조정하는 2단계 적응형 스티어링 파이프라인을 설계했다.
제안한 방법은 모든 평가 모델에서 교정 정렬을 크게 개선했으며, 자신감과 정확도 간 괴리의 근본 원인을 메커니즘 수준에서 밝혀낸 데 의의가 있다. 이는 LLM의 신뢰성 향상에 기여할 수 있다.