본문으로 건너뛰기

원인지식: AI 학습 데이터셋의 레코드 및 토큰 수준 데이터 원천성

AI 모델 훈련 데이터셋에서 데이터 제공자가 삭제 요청을 하면, 모델 훈련자들은 실질적인 문제를 맞이하게 됩니다. 기존의 원천성 시스템은 파일 또는 데이터셋의 수준에서 작동하여, 비도태적 오버-삭제를 초래합니다. 우리는 ob를 제시합니다, 레코드 및 토큰 수준의 데이터 원천성 시스템으로, 데이터 처리 파이프라인에서 저자 정체성을 전파하고, 결정적 쿼리에서 정확한 잊어버리 집합으로 revocation 요청을 해결합니다.

AI 자동 생성

원인지식: 레코드 및 토큰 수준 데이터 원천성

원인지식(ob)은 레코드 및 토큰 수준의 데이터 원천성 시스템으로, AI 모델 훈련 데이터셋에서 데이터 제공자가 삭제 요청을 하면, 모델 훈련자들이 실질적인 문제를 맞이하게 됩니다. 기존의 원천성 시스템은 파일 또는 데이터셋의 수준에서 작동하여, 비도태적 오버-삭제를 초래합니다.

원인지식(ob)은 데이터 처리 파이프라인에서 저자 정체성을 전파하고, 결정적 쿼리에서 정확한 잊어버리 집합으로 revocation 요청을 해결합니다. 이를 통해, 모델 훈련자는 정확한 데이터를 삭제할 수 있습니다.

  • 레코드 수준의 원천성: 원인지식(ob)은 레코드 수준의 원천성을 제공하여, 데이터 제공자가 삭제 요청할 때 정확한 레코드를 삭제할 수 있습니다.
  • 토큰 수준의 원천성: 원인지식(ob)은 토큰 수준의 원천성을 제공하여, 데이터 제공자가 삭제 요청할 때 정확한 토큰을 삭제할 수 있습니다.
  • 데이터 처리 파이프라인: 원인지식(ob)은 데이터 처리 파이프라인에서 저자 정체성을 전파하여, 데이터 제공자가 삭제 요청할 때 정확한 데이터를 삭제할 수 있습니다.
  • 결정적 쿼리: 원인지식(ob)은 결정적 쿼리에서 정확한 잊어버리 집합으로 revocation 요청을 해결하여, 모델 훈련자가 정확한 데이터를 삭제할 수 있습니다.

실험 결과

원인지식(ob)은 219,555개의 위키 페이지에서 실험을 수행하여, 레코드 수준의 원천성이 데이터셋 수준의 원천성보다 더 정확한 결과를 제공한다는 것을 확인했습니다.

실험 결과를 요약하면 다음과 같습니다.

  • 레코드 수준의 원천성: 원인지식(ob)은 데이터셋 수준의 원천성보다 101배에서 1.3배까지 정확한 결과를 제공합니다.
  • 토큰 수준의 원천성: 원인지식(ob)은 데이터셋 수준의 원천성보다 1.3%에서 4.0%까지의 성능 향상을 제공합니다.
  • 데이터 처리 파이프라인: 원인지식(ob)은 데이터셋 수준의 원천성보다 2.1%에서 19.0%까지의 성능 향상을 제공합니다.
  • 결정적 쿼리: 원인지식(ob)은 데이터셋 수준의 원천성보다 42%까지의 성능 향상을 제공합니다.
원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.