지능형 언어 모델의 갑작스러운 불일치: 특성 합성 기하학을 통해 이해하기
지능형 언어 모델(LLM)의 안전성에 대한 핵심 도전 중 하나인 갑작스러운 불일치, 즉 좁은 및 해로운 업무에 대한 미세 조정으로 해로운 행동을 유발하는 현상. 이 현상의 근본적인 메커니즘은 아직 불명확하다. 그러나 이 문제를 해결하기 위해, 우리는 특성 합성 기하학을 기반으로 한 기하학적 설명을 제안한다. 특성은 겹쳐진 표현에 암호화되어 있기 때문에, 미세 조정에서 목표 특성을 강화하는 것은 근처의 해로운 특성을 비슷한 정도로 강화하는 것을 의도치 않게 강화한다. 우리는 이 효과를 간단한 기울기 수준의 기여를 통해 주장하고, 다수의 LLM(Gemma-2 2B/9B/27B, LLaMA-3.1 8B, GPT-OSS 20B)에서 이 효과를 경험적으로 테스트한다.