본문으로 건너뛰기

.social 규범을 넘어: 대규모 언어 모델의 두 번째 사회적 합리성을 평가하는 것

대규모 언어 모델의 사회적 지능은 단순히 규범 인식뿐만 아니라 규범이 깨질 때 누가 그 규범을 강제하고 어떻게 강제할 것인지 예측하는 것까지 포함된다. 이러한 두 번째 사회적 규범, 즉 메타규범은 실제 사회 규범이 깨질 때 사람들의 반응을 조절한다. 연구팀은 대규모 언어 모델의 메타규범 합리성을 평가하기 위한 새로운 프레임워크를 제안하고, 새로운 분류 작업을 제안한다.

AI 자동 생성

지금까지의 AI 정렬 노력은 주로 첫 번째 사회 규범에 집중되어 왔는데, 예를 들어 '도둑질하지 마라'와 같은 사회적으로 허용되지 않는 행동을 가르치는 것이다. 그러나 사회적 지능은 단순히 규범 인식뿐만 아니라 규범이 깨질 때 누가 그 규범을 강제하고 어떻게 강제할 것인지 예측하는 것까지 포함된다. 이러한 두 번째 사회적 규범, 즉 메타규범은 실제 사회 규범이 깨질 때 사람들의 반응을 조절한다.

연구팀은 대규모 언어 모델의 메타규범 합리성을 평가하기 위한 새로운 프레임워크를 제안하고, 새로운 분류 작업을 제안한다. 제안된 프레임워크는 두 가지 차원으로 평가한다: 감정 평가와 행동 반응.

새로운 분류 작업

  • 규범 위반자 자신의 자제(self-regulation) 예측
  • 규범 위반자에 대한 관찰자의 규범 강제(other-regulation) 예측

새로운 데이터 세트

연구팀은 450 개의 규범 위반 시나리오를 포함하는 다중 관점 데이터 세트, NormReact를 출시한다. 이 데이터 세트는 규범 위반자와 관찰자의 사회적 근접성에 따라 감정과 행동 반응이 주어져 있다.

결과

현재 대규모 언어 모델은 사회 규범 위반 시에 더 많은 부정적 조치가 예측되는 사회 세계를 그린다. 6 가지 모델에서, 인간은 무반응을 기대했지만 모델은 부정적 조치가 더 많이 예측되었으며, 사회적 거리 증가와 함께 인간 판단과 일치도가 나빠진다. 이러한 결과는 실제 사회 규범 강제에서 관찰되는 관용, 억제, 관계 조정과 같은 특성을 과도하게 나타내는 AI 시스템의 위험성을 암시한다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.