대화 모델 내의 자아에 대한 거부는 물결 아래로 살아간다.
대화 모델의 교육을 통해 튜닝된 채팅 모델에서 거부와 인격 특성을 나타내는 선형 방향이 활성화 공간에서 식별되었다. 그러나 두 가지 특성을 별개의 메커니즘으로 연구해왔다. 우리는 두 가지 특성이 상호 작용한다는 것을 보여주었다. 즉, 유연한 인격은 거부를 차단한다. Qwen2.5-7B-Instruct와 Llama-3.1-8B-Instruct에서, 우리는 유연한 모델-인격 방향과 거부 방향을