본문으로 건너뛰기

음성 기반 대화하는 얼굴을 위한 음소 구동 3D 그래픽 시스템

3D Gaussian Splatting (3DGS) 기술은 빠르고 photorealistic한 말하는 얼굴 렌더링을 지원하지만, 정확한 입 운동은 여전히 어렵다: 입 운동은 종종 과도하게 smooth화되어 hard articulatory constraint(예: bilabial closure)와도 충돌하여 유명한 "leaky mouth" artifact를 생산한다. 핵심 난점은 연속적인 음성

AI 자동 생성

음성 기반 대화하는 얼굴을 위한 음소 구동 3차원 그래픽 시스템은 빠르고 현실적인 말하는 얼굴 렌더링을 지원하지만, 정확한 입 운동은 여전히 어렵다. 입 운동은 종종 과도하게 매끄럽게 만들어져서 입의 움직임 제약과 충돌하여 유명한 "입이 벌어지는" 오류를 만들어낸다. 이러한 문제는 연속적인 음성 인코딩에서 짧고 구별된 발음 이벤트를 추론하는 데 있다.

최신 자가 교육된 음성 인코더는 풍부한 억양 및 발음 단서를 제공하지만, 닫힘 수준의 이벤트를 신뢰할 수 있는 명시적인 프레임 정렬된 언어 목표를 제공하지 않는다. 이를 해결하기 위해 자동 음성 인식 및 강제 정렬 파이프라인에서 얻은 시간 정렬된 음소 토큰을 3차원 그래픽 시스템 대화자에 추가하여 음소 구동 가우시안 스플래팅을 제안한다.

음소 구동 가우시안 스플래팅

음소 구동 가우시안 스플래팅의 핵심 구성 요소, 언어적 융합 모듈은 학습된 게이트를 통해 연속적인 음성 컨텍스트와 구별된 음소 임베딩을 적응적으로 융합하여 모델이 발음에 중요한 구간에서 음소 지침을 강화하면서도 매끄러운 음성 주도 동기를 보존할 수 있도록 한다. 음소 구동 가우시안 스플래팅은 단안 비디오만 사용하여 이미지 재구성 및 입 랜드마크 감독만으로 학습된다.

음소 구동 가우시안 스플래팅은 비교한 기준 모델들 중 입 모양에서 가장 우수하며, 어려운 음소 순서에서 닫힘 위반이 줄어들어 더 언어적으로 충실한 뉴럴 어바타를 생성한다. 이러한 결과는 음성 기반 대화하는 얼굴을 위한 음소 구동 3차원 그래픽 시스템의 정확성과 현실성을 향상시키는 데 기여할 수 있다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.