대형 언어 모델의 자이르브레이크 성공을 위한 최소한의, 지역적, 인과적 설명
대형 언어 모델(LLM)의 자이르브레이크 성공을 위한 최소한의, 지역적, 인과적 설명 안전 훈련된 대형 언어 모델(LLM)은 자이르브레이크 요청에 대해 해로운 답변을 제공하도록 유도할 수 있다. 왜 LLM이 자이르브레이크에 취약한지에 대한 강력한 이해가 부족하기 때문에, 더 자율적으로 작동하는 더 높은 수준의 스테이크가 있는 환경에서 작동하는 미래의 프론티어 모델도 유사한 공격에 취약할 것이다. 이전 연구는 모델의 중간 표현을 조사하여 해로운성과 거부와 같은 개념을 인과적으로 인코딩하는 방향을