본문으로 건너뛰기

TTE-Flash: Chain-of-Thought를 통해 멀티모달 표현을 가속화하는 '생각-그후-임베딩 토큰'

AI 자동 생성

연구진은 Chain-of-Thought(CoT) 논리를 통해 Universal Multimodal Embedding(UME)의 성능을 크게 향상시켰다. 하지만 CoT를 생성하는 데 필요한 컴퓨팅 자원은 종종 부담이 된다. 연구진은 CoT를 생성하는 대신 latent think 토큰을 사용하여 CoT를 생성하는 것을 방지한다. 이 연구에서는 think 토큰과 임베딩 토큰을 추출하는 방법과 think 토큰과 임베딩 토큰을 학습하는 방법에 대한 두 가지 주요 아키텍처 디자인을 조사한다.

연구 방법

연구진은 TTE-Flash-2B라는 새로운 멀티모달 표현 모델을 제안한다. 이 모델은 대규모 언어 모델(LLM)에서 think 토큰과 임베딩 토큰을 추출한다. 연구진은 think 토큰과 임베딩 토큰을 학습하는 방법에 대한 두 가지 주요 아키텍처 디자인을 조사한다.

결과

연구진은 TTE-Flash-2B가 MMEB-v2 벤치마크에서 explicit-CoT 대비 성능이 우수함을 발견했다. 연구진은 think 토큰이 textually와 visually interpretable임을 발견했다. 연구진은 zero-shot evaluation을 통해 15개의 비디오 데이터셋에서 scaling behavior를 발견했으며, task requirements에 따라 adaptive think budget allocation의 필요성을 발견했다.

도출

연구진은 TTE-Flash-2B가 멀티모달 표현을 가속화하는 Chain-of-Thought 논리를 사용하여 성능을 향상시킨다는 것을 발견했다. 연구진은 think 토큰과 임베딩 토큰을 학습하는 방법에 대한 두 가지 주요 아키텍처 디자인을 조사했다. 연구진은 TTE-Flash-2B가 MMEB-v2 벤치마크에서 explicit-CoT 대비 성능이 우수함을 발견했다. 연구진은 think 토큰이 textually와 visually interpretable임을 발견했다. 연구진은 zero-shot evaluation을 통해 15개의 비디오 데이터셋에서 scaling behavior를 발견했으며, task requirements에 따라 adaptive think budget allocation의 필요성을 발견했다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.