본문으로 건너뛰기

LLM의 변동성은 지식의 깊이를 드러내지 않는다: 온도 변동성과 모델 다양성의 차이점

대규모 언어 모델(LLM)의 반복 실행에서 다른 답변을 얻을 때, 그 변동성은 모델이 모르는 것을 드러내는 것일까? 자기 일관성은 다수 투표를 통해 변동성을 질문별 불확실성 추정치로 변환시킨다. 그러나 변동성은 다중 모델의 다양성과 같은 관련 질문이 함께 변동하는 구조를 드러내는 것일까? 우리는 동일한 질문에 대해 두 가지 방식을 비교한다: 하나의 모델을 100번 실행하는 것 versus 24개의 LLM을 한번씩 실행하는 것. 마르첸코-파스트루(random-matrix) 테스트는 두 가지 경우 모두 신호와 샘플링 잡음 사이를 분리한다. 단일 모델 내에서, 최대 5개의 가족과 3개의 벤치마크(MMLU, HellaSwag, GSM8K)에서 noise edge를 넘는 차원이 하나 이상 존재할 수 있다. 그러나 다중 모델 집합 내에서, 4개의 고유값이 noise edge를 넘어간다. 이는 matched-difficulty Bernoulli null에서 500회 Monte Carlo 추출 중에서 1회에 해당하는 확률이다. 자기 일관성은 질문별 정확한 불확실성 추정치를 제공하지만, 관련된 질문이 함께 변동하는 구조는 드러나지 않는다. 다중 모델 집합만이 모델이 모르는 것을 드러낼 수 있다.

AI 자동 생성

LLM의 변동성은 지식의 깊이를 드러내지 않는다

대규모 언어 모델(LLM)의 반복 실행에서 다른 답변을 얻을 때, 그 변동성은 모델이 모르는 것을 드러내는 것일까? 자기 일관성은 다수 투표를 통해 변동성을 질문별 불확실성 추정치로 변환시킨다. 그러나 변동성은 다중 모델의 다양성과 같은 관련 질문이 함께 변동하는 구조를 드러내는 것일까?

온도 변동성과 모델 다양성의 차이점

온도 변동성은 LLM의 반복 실행에서 다른 답변을 얻을 때, 그 변동성을 질문별 불확실성 추정치로 변환시키는 자기 일관성을 사용한다. 그러나 모델 다양성은 다중 모델 집합을 사용하여 관련된 질문이 함께 변동하는 구조를 드러내는 것을 허용한다.

연구 결과

연구에서는 동일한 질문에 대해 두 가지 방식을 비교한다: 하나의 모델을 100번 실행하는 것 versus 24개의 LLM을 한번씩 실행하는 것. 마르첸코-파스트루(random-matrix) 테스트는 두 가지 경우 모두 신호와 샘플링 잡음 사이를 분리한다.

단일 모델의 결과

  • 최대 5개의 가족과 3개의 벤치마크(MMLU, HellaSwag, GSM8K)에서 noise edge를 넘는 차원이 하나 이상 존재할 수 있다.
  • 그러나 다중 모델 집합 내에서, 4개의 고유값이 noise edge를 넘어간다.

다중 모델 집합의 결과

  • matched-difficulty Bernoulli null에서 500회 Monte Carlo 추출 중에서 1회에 해당하는 확률이다.
  • 자기 일관성은 질문별 정확한 불확실성 추정치를 제공하지만, 관련된 질문이 함께 변동하는 구조는 드러나지 않는다.
  • 다중 모델 집합만이 모델이 모르는 것을 드러낼 수 있다.
원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.