AI 모델 4월 9일
잦은 착각 신호를 Transformer 표현으로 분리하는 약한 감독 학습
대규모 언어 모델(LLM)의 착각 감지 방법은 일반적으로 인출 시점에서 외부 검증이 필요하며, 금본문, 검색 시스템 또는 보조 심판 모델이 필요합니다. 이 연구에서는 대규모 언어 모델(LLM)의 표현에 있는 착각 감지 신호를 훈련 시점에 있는 외부 감독 대신 분리할 수 있는지 여부를 물어봅니다. 우리는 약한 감독 프레임워크를 제시하며, 이 프레임워크는 세 가지 상호 보완적인 기반 신호를 결합합니다: 서브스트링 매칭, 문장 임베딩 유사도 및 대규모 언어 모델(LLM)을 심판 판결로 사용하여 생성된 응답을 기반으로 착각 또는 기반으로 라벨링합니다. 이 프레임워크를 사용하여, 우리는 SQuAD v2(10500 훈련/개발 샘플 및 별도의 5000 샘플 테스트 세트)에서 15000 샘플 데이터 세트를 구성합니다. 각 샘플은 LLaMA-2-7B가 생성한 답변과 전체 계층별 숨겨진 상태 및 구조화된 착각 레이블을 쌍으로 구성합니다. 우리는 다섯 가지 프로빙 분류기를 훈련시킵니다: ProbeMLP(M0), LayerWiseMLP(M1), CrossLayerTransformer(M2), HierarchicalTransformer(M3), 및 CrossLayerAttentionTransformerV2(M4), 이 숨겨진 상태에 직접 적용하고, 외부 기반 신호를 훈련 시점의 감독으로만 사용합니다. 우리의 중심 가설은, 착각 감지 신호가 Transformer 표현으로 분리될 수 있으며, 인출 시점에서 외부 검증이 필요하지 않습니다. 결과는 이 가설을 지지합니다. Transformer 기반 프로빙 분류기는 가장 강한 차별력을 나타내며, M2가 5개 단계의 평균 AUC/F1에서 가장 좋고, M3가 단일 단계의 검증 및 보유 한 테스트 평가에서 가장 좋습니다. 우리는 또한 인출 효율성을 평가합니다: 프로빙 지연 시간은 0.15에서 5.62 ms(배치) 및 1.55에서 6.66 ms(단일 샘플)이며, 종단-to-end 생성 및 프로빙 통과율은 약 0.231 쿼리당 초로, 실질적인 오버헤드가 거의 없는 것으로 나타납니다.