본문으로 건너뛰기

다양한 문서에서 지식 그래프 생성을 위한 ontology-_guided, deduplication-aware extraction layer

대규모 언어 모델(LLM)은 구조화되지 않은 문서에서 엔티티와 관계를 꾸준히 추출하지만 불일치가 발생한다: 문서 간 유형의 어휘가 분열되어 있다, 동일한 사람의 이름이 여러 버전으로 나타난다, 관계가 중복되어 있으며 이름을 공유하는 개별 인물은 침묵적인 혼동의 위험이 있다. 이 논문은 프로덕션 추출層을 설계, 구현, 그리고 경험적 정교화를 통해 실시간 문서 스트림을 형식적 온톨로지와 일치하는

AI 자동 생성

지식 그래프 생성의 도전

대규모 언어 모델(LLM)은 구조화되지 않은 문서에서 엔티티와 관계를 꾸준히 추출하지만 불일치가 발생한다. 문서 간 유형의 어휘가 분열되어 있고, 동일한 사람의 이름이 여러 버전으로 나타나며, 관계가 중복되어 이름을 공유하는 개별 인물은 침묵적인 혼동의 위험이 있다. 이러한 문제는 지식 그래프 생성을 어렵게 만든다.

이러한 도전을 극복하기 위해, 연구자들은 프로덕션 추출층을 설계, 구현, 그리고 경험적 정교화를 통해 실시간 문서 스트림을 형식적 온톨로지와 일치하는 검증된 지식 그래프로 변환하는 시스템을 제시했다. 시스템은 다양한 문서 형식에서 엔티티와 관계를 추출하여 지식 그래프를 생성한다.

온톨로지 가이드드 추출

시스템의 가장 특징적인 구성 요소는 온톨로지 가이드드 추출이다. curated 온톨로지의 관련한 슬라이스를 실시간으로 그래프 데이터베이스에서 불러와 추출 프롬프트에 삽입하여 정적 도메인 슬라이스 대비 약 94%의 카탈로그 오버헤드를 줄였다. 이 접근법은 지식 그래프 생성의 정확성과 효율성을 향상시킨다.

추출된 결과는 5 단계의 정제 pipeline을 통해 정리된다. 결정론적 청소, chunk 간 병합, 관계에 대한 두 번째 패스, 중복 제거 알고리즘, 그리고 충돌 경비가 유사도 점수가 오버라이드할 수 없도록 하는 임베딩 해결 subsystem을 통해 지식 그래프의 품질을 향상시킨다. 이러한 접근법은 지능적 코퍼스를 대상으로 한 평가에서 검색 회귀율을 약 70%에서 95%로 향상시키고, 정확한 병합이 없이 7개의 침묵적인 품질 결함을 수정했다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.