본문으로 건너뛰기

iFLYTEK-인체와 상호작용하는 모든 기술 보고서

AI 자동 생성

대규모 언어 모델(LLM)과 같은 일반적인 몸체 있는 agent는 다중 모드 지시를 이해하고, 환경이 어떻게 진화할 것인지 예측하고, 장기적인 시야에서 정확한 제어 액션을 생성해야 합니다. 기존 접근 방식은 일반적으로 시각-언어 추론, 비디오 기반 월드 모델링, 또는 액션 생성에 특화되어 있으며, 관찰을 미리 합성하고 나서 액션을 추론하는 계열 pipeline가 인터페이스 병목 현상을 유발하고 예측 오류를 격증할 수 있습니다. 우리는 iFLYTEK-Embodied-Omni라는 통합 다중 모드 기초 모델을 제시합니다. 이 모델은 단일 Omni framework 내에서 시각(videos와 images), 언어, 그리고 액션을 공동으로 모델링합니다. 모드에 특화된 시각-언어, 비디오 생성, 액션 생성 컴포넌트는 공유 다중 모드 자기 주의를 통해 통신합니다. 이 디자인은 뇌-뇌뇌 협력체계를establish: 시각-언어 모델과 비디오 생성 모델은 지시 이해, 작업 계획, 진행 추적, 그리고 미래 시각 상태 예측에 대한 고급 뇌를 형성합니다. 반면, 액션 생성 모델은 계획된 subgoal과 공유 다중 모드 맥락을 직접 실행할 수 있는 액션 블록으로 변환하는 낮은 수준의 뇌뇌뇌입니다. 이러한 기능성을 개발하기 위해, 우리는 인간의 데모와 로봇 상호작용과 함께 embodied reasoning, embodied perception, 그리고 일반적인 목적의 image-text 데이터를 사용하여 comprehensive dataset을 구성합니다. 또한 우리는 VLM, VGM, 그리고 AGM을 먼저 단계적으로 학습한 후 완전한 모델을 함께 fine-tuning하는 4단계 전략을 채택합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.