본문으로 건너뛰기

유니버설 오모드 임베딩의 경계를 확장하는 오비스 임베딩

AI 자동 생성

이 연구에서는 **Ovis-Embedding**이라고 부르는 cutting-edge의 모든 모드(omni-modal) 임베딩 패밀리를 소개합니다. 이 임베딩은 텍스트, 이미지, 비디오, 오디오를 포함하는 원시 통합에 기반합니다. 기존의 임베딩은 각 모드별로 별개의 모드 탑(tower)을 구성하는 대신, Ovis-Embedding은 공통된 다모드 백본(backbone)을 사용하여 다중 모드 데이터를 공통된 표현 공간에 인코딩합니다. 구체적으로, 우리는 다음 세 가지 주요 발전을 이루었습니다. 1. **원시 다모드 초기화(native omni-modal initialization)**: 우리는 미리 훈련된 Qwen-omni 모델을 임베딩 백본으로 채택하고 저_rank 초기화를 통해 대조적 훈련을 수행합니다. 2. **데이터 중심 다모드 훈련(data-centric omni-modal training)**: 우리는 텍스트, 이미지, 비디오, 오디오, 그리고 이들 모드를 이중화한 다중 모드 데이터를 포함하는 광범위하고 고품질의 코퍼스를 구성합니다. 데이터 효율성을 개선하기 위해, 우리는 일관된 작업 배치(task-consistent batch)를 형성하고 정보가 풍부한 인 배치 내 부정(examples) 샘플링을 소개합니다. 3. **임베딩 특이 훈련 및 추론 최적화(embedding-specific training and inference optimization)**: 우리는 불균형 예제를 강조하기 위해 focal loss를 사용하고 상관 관계 기반 임베딩 이식(distillation)을 통해 보다 세세한 유사성 구조를 전달하는 보완적인 전문가들로부터 유사성 구조를 전달합니다. 추론 시에는 저_rank 특성 분해가 가능한 임베딩을 생성할 수 있고, 임베딩의 유연한 차원 및 최소 성능 손실을 허용합니다. 실험적 평가 결과, **Ovis-Embedding** 패밀리는 **MMEB-v3**, **MMEB-v2**, **MVEB**, **MAEB**, 및 **RTEB**에서 cutting-edge의 성능을 달성하여 텍스트, 이미지, 비디오, 오디오 모드에 걸쳐 그 효과성을 입증합니다. 이 결과는 모드 분열(fragmentation)을 극복하고 모든 모드에 걸쳐 유니버설 임베딩 모델을 진전시키기 위해 통일된 다모드 훈련의 잠재력을 강조합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 22시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.