본문으로 건너뛰기

대화 기억의 Intervention 품질에 대한 제안된 Bench-mark인 TWIST: 인간이 검증한 Draft-Alignement

arXiv:2609.28575v1 발표 형식: 새로운 발표 요약: 장기 대화 메모리 벤치마크는 최근 사용자의 믿음과 메모리 상태의 진화에 대한 연구를 수행하는 동안 회상과 유도된 지식 업데이트와 관련된 회상 및 유도된 지식 업데이트 recall을 점점 더 테스트합니다. TWIST는 deployed 메모리 시스템의 intervention quality, 즉 belief change 지점에서 c

AI 자동 생성

대화 기억의 Intervention 품질에 대한 새로운 벤치마크

대규모 언어 모델(LLM)과 대화 시스템의 성능을 평가하기 위한 새로운 벤치마크가 제안되었습니다. TWIST는 대화 기억의 Intervention 품질을 평가하는 데 중점을 둔 벤치마크로, 사용자의 믿음과 메모리 상태의 진화에 대한 연구를 수행하는 동안 회상과 유도된 지식 업데이트와 관련된 회상 및 유도된 지식 업데이트를 테스트합니다. 이 벤치마크는 deployed 메모리 시스템의 intervention quality, 즉 belief change 지점에서 correct하게 작동하는지 여부를 테스트하는 complementory, unmeasured 속성을 제안합니다. TWIST 벤치마크는 4개의 트랙으로 구성되어 있습니다. 첫 번째 트랙은 unprompted tension detection을 포함하며, 두 번째 트랙은 outgoing drafts가 기록과 비교하여 vetting을 포함합니다. 세 번째 트랙은 현재 믿음으로 대답하면서 supersession history를 보존하는 것을 포함하며, 네 번째 트랙은 sensitive recall을 govern하는 것입니다. 이 벤치마크는 LoCoMo의 corpora와 harness를 확장하여, detect/block metric에 matched do-not-over-detect control을 pair합니다. surface-matched hard negatives는 false intervention의 가격을 부과하여, 모든 트랙이 flagging everything으로 게임을 할 수 없도록 합니다.

벤치마크의 검증

벤치마크 자체는 첫 번째로 validate됩니다. independent, gold-blind double annotation with adjudication, judge decoy calibration, separability audit를 수행합니다. human-validated Track B v1.0 key에 대한 경우, 테스트된 모든 구성이 simultaneously high contradiction recall, high hard-negative specificity, high attribution을 달성하지 못합니다. flat-RAG baseline은 true contradictions를 detect하지만, surface-matched safe drafts를 falsely flag합니다. 반면 coherence-oriented 시스템은 specificity를 달성하면서 true contradictions를 detect하지 못합니다. 이러한 결과는 TWIST 벤치마크가 대화 기억의 Intervention 품질을 평가하는 데 효과적인 도구임을 보여줍니다. TWIST 벤치마크는 대규모 언어 모델(LLM)과 대화 시스템의 성능을 평가하기 위한 새로운 기준을 제공합니다. 이 벤치마크는 사용자의 믿음과 메모리 상태의 진화에 대한 연구를 수행하는 동안 회상과 유도된 지식 업데이트와 관련된 회상 및 유도된 지식 업데이트를 테스트합니다. 이러한 연구는 대화 시스템의 성능을 향상시키고, 사용자와의 상호작용을 더 자연스럽고 효율적으로 만드는 데 중요한 역할을 할 것입니다.
원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 22시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.