Faithfulness to Refusal: A Causal Audit of Neuron Selectors
Ananth Eswar, Pratinav Seth, Utsav Avaiya, Vinay Kumar Sankarapu
언어 모델의 뉴런 행을 식별하는 속성 점수의 인과적 유효성을 직접 테스트하는 감사 프레임워크를 제안합니다.
속성 점수는 모델의 특정 기능(예: 거부)에 중요하다고 식별된 뉴런 행이 실제로 인과적으로 중요한지, 아니면 단순히 상관관계가 있는지 직접 테스트하는 방법이 부족합니다.
일회성 뉴런 행 제로잉 기반의 두 가지 감사를 수행합니다. 첫째, 언어 모델링 수준에서 속성 방법이 기존 기반선보다 폐기 가능한 행을 더 잘 식별하는지 평가합니다. 둘째, 대비되는 유해-무해 신호를 사용하여 식별된 행이 거부 능력을 설치하는 데 충분한지 테스트합니다.
속성 방법은 기반선을 크게 능가하여 폐기 가능한 행을 식별합니다. 또한, 특정 층에서 무작위 대조군이 실패하는 동안, 속성된 행은 혐오 및 범죄에 대한 거부를 설치하기에 충분합니다. 그러나 높은 순위 안정성을 가진 선택자가 인과적 유효성이 가장 낮을 수 있으며, 거부는 중복된 부분 공간에 존재하여 서로 다른 속성 방법이 대부분 불연속적인 행 집합을 통해 이를 설치함을 발견했습니다. 이는 순위 안정성이 인과적 감사가 발견할 수 있는 선택자 실패 유형을 놓친다는 것을 보여줍니다.