본문으로 건너뛰기

표면적인 디자인 너머: 사용자 시뮬레이터를 행동 일관성과 일치시키기

AI 자동 생성

인터랙티브 인공지능(Interactive AI)을 대규모로 개발하고 평가하며 개선하는 데는 충실한 사용자 시뮬레이션(faithful user simulation)이 필수적입니다. 그러나 합리적인 개인적인 응답(plausible individual responses)이 실제 상호 작용에서 관찰되는 의도 진화(intent evolution)와 결과물(outcomes)을 재현하는 것은 보장하지 못합니다. 우리는 TRACER라는 다중 턴 사용자 시뮬레이터(multi-turn user simulator)를 제안하는데, 이는 사용자의 진화하는 의도를 명시적으로 모델링하고 실제 상호 작용 경로(interaction trajectories)와 시뮬레이션된 행동을 일치시키는 것을 배움니다. TRACER는 2개의 단계로 훈련됩니다: 첫 번째는 실제 사용자 대화(dialogues)에서 지도 학습 지도 학습(supervised fine-tuning)으로, 두 번째는 다중 턴 강화 학습(multi-turn reinforcement learning)으로. 강화 학습 단계에서 계층적 결과물- 및 경로-레벨 보상(hierarchical outcome- and trajectory-level rewards)과 이탈-지각 장애(modulation)가 결합되어, 장기 대화(long dialogues)에서 보상 희소성(reward sparsity)과 신뢰할 수 있는 할당(credit assignment)을 동시에 완화합니다. 실제 고객 서비스 세션을 참조 코호트(reference cohorts)로 구성한 경우, TRACER-7B는 가장 강력한 기준선(baseline)보다 11.4%의 변환 F1를 초과하며, 또한 그룹 수준의 변환율 오류(group-level conversion-rate error)와 의미적 경로 거리(semantic trajectory distance)를 가장 낮게 달성하며, 또한 분포 외의 상황(out-of-distribution scenarios)으로 일반화합니다. 인간 터링 테스트(human Turing tests)에서 식별 정확도는 거의 우선(일치)을 지원하며, 생성된 대화가 자연스럽게 보이는 것을 증명합니다. 이 시뮬레이터를 기반으로, 우리는 동적 마케팅 벤치마크(Dynamic Marketing Benchmark)를 추가로 제안하는데, 이는 LLMs가 시뮬레이션 상호 작용을 통해 설득 효과iveness와 응답 품질을 동시에 평가합니다. 이는 더 높은 응답 품질이 반드시 더 높은 변환율에 대응하는 것은 아님을 밝힙니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 22시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.