AI 모델 7월 24일
LLM의 변동성은 지식의 깊이를 드러내지 않는다: 온도 변동성과 모델 다양성의 차이점
대규모 언어 모델(LLM)의 반복 실행에서 다른 답변을 얻을 때, 그 변동성은 모델이 모르는 것을 드러내는 것일까? 자기 일관성은 다수 투표를 통해 변동성을 질문별 불확실성 추정치로 변환시킨다. 그러나 변동성은 다중 모델의 다양성과 같은 관련 질문이 함께 변동하는 구조를 드러내는 것일까? 우리는 동일한 질문에 대해 두 가지 방식을 비교한다: 하나의 모델을 100번 실행하는 것 versus 24개의 LLM을 한번씩 실행하는 것. 마르첸코-파스트루(random-matrix) 테스트는 두 가지 경우 모두 신호와 샘플링 잡음 사이를 분리한다. 단일 모델 내에서, 최대 5개의 가족과 3개의 벤치마크(MMLU, HellaSwag, GSM8K)에서 noise edge를 넘는 차원이 하나 이상 존재할 수 있다. 그러나 다중 모델 집합 내에서, 4개의 고유값이 noise edge를 넘어간다. 이는 matched-difficulty Bernoulli null에서 500회 Monte Carlo 추출 중에서 1회에 해당하는 확률이다. 자기 일관성은 질문별 정확한 불확실성 추정치를 제공하지만, 관련된 질문이 함께 변동하는 구조는 드러나지 않는다. 다중 모델 집합만이 모델이 모르는 것을 드러낼 수 있다.