본문으로 건너뛰기

행동트레이스에서 실제 사용자 결정을 모델링하는 행동벤치

Decision-support 시스템은 사용자별로 적응할 수 있어야 하는데, 이 문제를 위한 평가 데이터는 여전히 제한적이다. 사용자 이해를 위한 기존 벤치마크는 주로 시뮬레이션된 사용자나 모델이 생성한 행동에 의존한다. 하지만 최근 연구는 모델 기반 시뮬레이션의 경우 인간 행동과 체계적으로 다르다고 경고한다. 우리는 \textsc{BehaviorBench}라는 사용자별 의사결정 모델링을 평

AI 자동 생성

사용자별 의사결정 모델링의 중요성

최근의 연구에서는 사용자별 의사결정 모델링의 중요성을 강조하고 있다. 의사결정 지원 시스템은 사용자별로 적응할 수 있어야 하는데, 이 문제를 위한 평가 데이터는 여전히 제한적이다. 사용자 이해를 위한 기존 평가 기준은 주로 시뮬레이션된 사용자나 모델이 생성한 행동에 의존한다. 하지만 모델 기반 시뮬레이션의 경우 인간 행동과 체계적으로 다르다고 경고한다.

이러한 문제를 해결하기 위해 새로운 평가 기준이 필요하다. 이를 위해 사용자별 의사결정 모델링을 평가하기 위한 평가 기준을 소개한다. 이 평가 기준은 공개 예측 시장과 체인 기록에서 관찰된 실제 행동 추적을 사용하여 지갑별 의사결정 기록을 재구성하고, 두 가지 상호 보완적인 작업 단계로 구성한다.

새로운 평가 기준의 특징

새로운 평가 기준에는 2,000개의 평가 지갑에 대해 141,445개의 의사결정 예측과 1,485,972개의 거래 예측이 포함되어 있으며, 이중에서 검색 기반 평가를 위한 별개의 지원 집합을 제공한다. 또한, 4가지의 기록 인터페이스: 사용자별화가 없는 인터페이스, 직접 최근 기록, 생성된 사용자 프로필, 및 지원 지갑 증거를 사용하여, 최전선과 개방형 가중 생성 모델을 평가한다.

사용자별화는 의사결정 예측에 더 일관되게 개선된다. 하지만 모델 순위는 작업 단계와 지표에 따라 다르며, 다른 기록 인터페이스는 다른 실패 모드를 노출한다. 새로운 평가 기준은 실제 행동 증거를 사용하여 사용자별화된 방법이 시뮬레이션된 사용자만 사용하는 것보다 더 잘 작동하는지에 대한 연구를 위한 평가 설정을 제공한다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.