본문으로 건너뛰기

장기 기억의 최종 정확도에서 놓친 부분을 탐색하는 MemTrace

대규모 언어 모델(LLM) 에이전트는 점차적으로 사용자의 정보를 여러 세션 동안 유지하는 장기 기억력을 유지하고 있습니다. 그러나 일반적으로 이러한 기억력은 질문 행이나 에피소드의 정확도 합계로 평가됩니다. 그러나 이 방법은 여러 질문이 동일한 사실을 조사하는 경우에도 각 질문 행을独立으로 평가하므로, 그 사실이 조건이 달라짐에 따라 어떻게 행동하는지 보여주지 못합니다. 우리는 MemTrac

AI 자동 생성

장기 기억력의 한계

대규모 언어 모델(LLM) 에이전트는 점차적으로 사용자의 정보를 여러 세션 동안 유지하는 장기 기억력을 유지하고 있습니다. 그러나 일반적으로 이러한 기억력은 질문 행이나 에피소드의 정확도 합계로 평가됩니다. 이 방법은 여러 질문이 동일한 사실을 조사하는 경우에도 각 질문 행을 독립으로 평가하므로, 그 사실이 조건이 달라짐에 따라 어떻게 행동하는지 보여주지 못합니다.

이러한 한계를 극복하기 위해 MemTrace라는 새로운 벤치마크를 소개합니다. MemTrace의 단위는 사용자에 대한 단일 타입의 사실인 지식 포인트(knowledge point)이며, 이는 개별 질문이 아닌 하나의 단위입니다. MemTrace는 각 사실을 세 가지 제어된 차원에서 조사합니다: 기억 나이(memory age), 질문 유형(question type), 그리고 증거 조건(evidence condition).

MemTrace의 발견

13개의 기억 시스템 구성과 4개의 패러다임을 평가한 결과, 동일한 풀링 정확도가 다른 실패를 숨기고 있음을 발견했습니다. 현재와 이전 상태를 회복하는 것은 사실의 변화를 추적하는 것을 의미하지 않고, 안전한 배제는 거짓 전제를 수정하는 것을 의미하지 않습니다. 또한, 증거 사용이 검색보다 주요한 벽돌이라는 사실을 발견했습니다.

시스템이 실패하는 경우, 증거가 도출 가능했을 때 10배 더 자주 누락되었습니다. 이러한 결과는 장기 기억력을 향상하기 위해서는 도달 가능한 증거를 더 효율적으로 사용해야 하며, 단순히 더 많은 저장 공간이나 검색을 제공하는 것만으로는 부족함을 시사합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.