본문으로 건너뛰기

텍스트와 이미지에 대한 생각: 장기 시야 로봇 조작을 위한 교차된 시각-언어 추론 경로

AI 자동 생성

장기 시야 로봇 조작을 위한 교차된 시각-언어 추론 경로

장기 시야 로봇 조작을 위해서는 논리적으로 일관되고 기하학적으로 기반을 둔 계획이 필요하다. 기존의 시각-언어-행동 정책은 계획을 잠재 상태에 숨기거나 하나의 모달리티만 노출한다. 텍스트만으로 구성된-chain-of-thought는 원인-결과 관계를 제시하지만 공간적 제약을 무시한다. 반면, 시각 예측은 기하학적 지시를 제공하지만 자주 지역적이고 의미적으로 제약적이다.

우리는 Interleaved Vision--Language Reasoning(IVLR)이라고 불리는 정책 프레임워크를 제시한다. IVLR은 \trace{}라는 명시적인 중간 표현을 사용하여 텍스트 서브 목표와 시각 키 프레임을 전체 작업 시야에 걸쳐 번갈아 가며 인터리빙한다. 테스트 시점에서, 1개의 원래 모드 트랜스포머가 초기 관찰과 명령을 기반으로 이 글로벌 의미-기하학적 트레이스를 자체 생성하고 캐시하고, 원래 명령, 현재 관찰, 그리고 트레이스를 기반으로 닫힌 루프 액션 디코더를 조건한다.

표준 로봇 데이터셋은 이러한 트레이스를 가지고 있지 않기 때문에, 우리는 시각-언어 모델을 사용하여 각 단계를 캡션하고 시간적으로 분할된 데모를 사용하여 가짜-supervision을 만든다. 장기 시야 조작과 시각 분포 변동에 대한 시뮬레이션 벤치마크에서, \method{}은 LIBERO에서 평균 성공률 95.5%를 alcanzes, LIBERO-Long에서 92.4%를 alcanzes, SimplerEnv-WidowX에서 59.4%를 alcanzes. Ablations은 두 모달리티가 모두 필요함을 보여준다: 트레이스를 없애면 LIBERO-Long 성공률은 37.7%로 떨어지며, 텍스트만의 트레이스는 62.0%를 alcanzes, 시각만의 트레이스는 68.4%를 alcanzes, 반면, 전체 인터리빙된 트레이스는 92.4%를 alcanzes.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.