본문으로 건너뛰기

대화 모델 내의 자아에 대한 거부는 물결 아래로 살아간다.

대화 모델의 교육을 통해 튜닝된 채팅 모델에서 거부와 인격 특성을 나타내는 선형 방향이 활성화 공간에서 식별되었다. 그러나 두 가지 특성을 별개의 메커니즘으로 연구해왔다. 우리는 두 가지 특성이 상호 작용한다는 것을 보여주었다. 즉, 유연한 인격은 거부를 차단한다. Qwen2.5-7B-Instruct와 Llama-3.1-8B-Instruct에서, 우리는 유연한 모델-인격 방향과 거부 방향을

AI 자동 생성

대화 모델 내의 자아에 대한 거부 연구

대규모 언어 모델을 이용한 대화 모델은 점점 더 발전하고 있으며, 이러한 모델 내에서 자아에 대한 거부와 성격 특성을 나타내는 방향이 활성화 공간에서 식별되었다. 이러한 특성은 대화 모델의 교육을 통해 튜닝된 모델에서 발견되며, 이전에는 두 가지 특성을 별개의 메커니즘으로 연구해왔다. 그러나 최근 연구에서는 두 가지 특성이 상호 작용한다는 것을 보여주었다. 즉, 유연한 성격은 거부를 차단하는 것으로 나타났다. 대규모 언어 모델인 모델에서, 연구진은 유연한 모델-성격 방향과 거부 방향을 추출하고 두 방향 모두에 영향을 주었다. 이러한 조작은 유연한 성격 조종이 거부를 억제한다는 것을 보여주었다. 예를 들어, 모델에서 거부율은 97%에서 2%로 떨어졌다. 이러한 결과는 대화 모델 내에서 자아에 대한 거부가 어떻게 작동하는지에 대한 새로운 통찰력을 제공한다.

거부와 성격의 상호 작용

거부 방향을 재소개하면 후기 단계에서 거부를 부분적으로 복원하지만 초기 단계에서는 그렇지 않다. 후기 단계에서의 성격 방향을 제거하면 기본 상태로 돌아가며, 임의의 방향을 제거하면 그렇지 않다. 따라서 거부는 후기 단계의 표현 단계에서 차단된다. 이러한 발견은 대화 모델 내에서 자아에 대한 거부를 단일 고립된 방향으로 다루면 성격에 의존하는 것을 놓치게 된다는 것을 시사한다. 대신, 거부와 성격의 상호 작용을 고려하여 대화 모델을 설계하고 개선하는 것이 중요하다. 이러한 접근은 더 자연스럽고 효율적인 대화 모델을 개발하는 데 도움이 될 수 있다.
원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 3시간 전

AMD가 인공지능 회사 월드 랩스(Wold Labs)를 8억 달러 이상에 인수한다

AMD가 대규모 언어 모델(LLM) 및 인공지능(AI) 기술 연구소인 World Labs를 8억200만 달러 규모의 주식 교환으로 인수한다고 발표했다. World Labs는 2024년에 설립되었으며 몇 개월 만에 10억 달러 규모의 기업으로 성장했다. 이 스타트업은 첫 번째 상업 제품으로, 세계 생성 모델을 포함하는 AI 플랫폼을 출시했다.

AI 모델 9시간 전

시각성 겹침: 방향성 기원 내 개중량 모델 계통

가중치가 공개된 모델은 종종 최적화, 정렬, 병합, 다시 공개되는 과정을 거치게 되며, 모델의 기원에 대한 감사는 단순히 체크포인트가 관련되어 있는지 여부를 확인하는 것만이 아닌, 체크포인트 중 누가 먼저 만들어졌는지 또한 확인해야 하는 상황이 발생합니다. 현재까지 존재하는 모델 기원에 대한 방법들은 주로 기존에 알려진 모델을 대상으로 하는 감사 설정에 설계되어 있으며, 주어진 모델 중 한

AI 모델 1일 전

LLM이 문맥을 이해할 수 있는가? 지식 그래프 기반 평가 프레임워크

대규모 언어 모델(LLMs)가 언어 능력에 대해 놀라운 성과를 보인 것은 사실이지만, 그 모델의 심장에 깊이 있는 질문 하나가 남아 있다: 이러한 모델들이 정말로 문맥을 이해하거나 단순히 무려 대규모 패턴 매칭에만 능통한 것일까? 대규모 언어 모델에서 문맥 이해는 주어진 문맥에서 관련 정보를 정확하게 추출하고, 그것을 일관된 내부 표현으로 통합하고, 그 문맥을 바탕으로 사실적이고 문맥적으로

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.