대규모 언어 모델과 인간 선호도 조율을 위한 상위론 및 불확실성 인식 지향 디렉트 선호도 최적화
대규모 언어 모델(LLM)의 인간 선호도 조율을 위해 일반적으로 강화 학습으로부터 인간 피드백(RLHF)을 사용하거나, 더 단순하게 디렉트 선호도 최적화(DPO)를 사용합니다. 그러나 DPO는 선호도를 단순한 승자vs. 패자 신호로 다루고, 불확실성 또는 취약한 사고 체인으로부터 발생하는 노이즈 또는 가늘게 갈라진 선호도에 민감합니다. 우리는 상위론 및 불확실성 인식 지향 DPO의 변형인 TUR-DPO를 제안합니다. TUR-DPO는 DPO의 변형으로, 답변의 방법을 대신하여 답변의 내용을 보상하기 위해 가벼운 사고 체계를 유도하고, 의미적 충실성, 유용성 및 체계의 질을 조합하여 계측된 불확실성 신호로 조정합니다. 이러한 신호를 조합한 작은 학습 가능한 보상을 불확실성 가중치로 부여된 DPO 목표에 통합합니다. TUR-DPO는 RL-free이며, 고정 또는 이동 참조 정책에만 의존합니다. 실습 결과, 대규모 7-8B 모델과 다양한 벤치마크(수학적 사고, 사실적 질문 답변, 요약, 도움이 되는/해로운 대화)를 통하여 TUR-DPO는 DPO보다 심판 승률, 충실성 및 계측을 개선합니다.