본문으로 건너뛰기

시각-언어 합성 reasoning에서 좋은 시각 또는 좋은 생각?

시각-언어 모델(Vision-Language Models, VLMs)에서 강력한 시각-논리 동기화를 달성하는 것이 고급 VLM의 중심 목표입니다. 최근 연구는 이 목표를 달성하기 위해 아키텍처 디자인이나 주체적 워크플로우를 사용했습니다. 그러나 이러한 접근 방식은 종종 정적 텍스트 논리나 외부 주체적 복잡성의重大 계산 및 엔지니어링 부담으로 복잡해집니다. 더 나쁜 것은, 이러한 큰 투자가 비례하는 성과를 제공하지 않으며, 종종

AI 자동 생성
시각-언어 모델에서 강력한 시각-논리 동기화를 달성하는 것이 고급 시각-언어 모델의 중심 목표입니다. 최근 연구는 이 목표를 달성하기 위해 아키텍처 디자인이나 주체적 워크플로우를 사용했습니다. 그러나 이러한 접근 방식은 종종 정적 텍스트 논리나 외부 주체적 복잡성의 큰 계산 및 엔지니어링 부담으로 복잡해집니다. 더 나쁜 것은, 이러한 큰 투자가 비례하는 성과를 제공하지 않으며, 종종 이상한 효과를 보는 경우가 있습니다.

모달리티 크레딧 할당의 모호성

이러한 문제는 시각-논리 동기화에 대한 진정한 병목 현상을 재고하는 데 동기를 부여합니다. 이 논문에서, 우리는 시각-논리 동기화에 대한 이 상호 작용의 근본 원인이 모달리티 크레딧 할당의 모호성이라는 것을 주장합니다: 시각-언어 모델이 실패할 때, 이는 시각적 오류 또는 논리적 오류로 인한 것일까요? 이를 해결하기 위해, 우리는 시각적 신뢰성을 신뢰할 수 있도록 보상하는 강화 학습 프레임워크를 소개합니다. 우리는 생성 프로세스를 시각적 단계와 논리적 단계로 분리하여 조합합니다. 이 분리는 시각에 대한 표적 감독을 허용합니다. 중요한 것은, 우리는 시각적 신뢰성을 논리적 결과와 독립적으로 보상하기 위해 눈을 감은 논리 프록시를 사용하여 시각 검증을 소개합니다. 또한, 자유 형식 시각-언어 과제에 대한 훈련을 확장하기 위해, 우리는 구조화된 말하기 검증을 제안하여, 고 변동성 대규모 언어 모델 판단을 구조화된 알고리즘 실행으로 대체합니다. 이러한 기술은 모달리티 인지 크레딧 할당 메커니즘에 통합됩니다. 이는 오류의 특정 원인 - 시각적 오류 또는 논리적 오류 -에 보상을 라우팅하여, 단일 시각-언어 모델이 광범위한 작업 스펙트럼에서 동시에 성과를 개선할 수 있습니다. 이러한 접근 방식은 시각-언어 합성 추론에서 좋은 시각 또는 좋은 생각을 제공하는 데 도움이 될 수 있습니다.
원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 15시간 전

메타가 Muse AI 기기를 만드는 코드를 공개합니다.

메타(Meta)는 이제 여러분이 회사에서 개발한 새로운 인공지능 agent를 특징으로 하는 Muse 기기를 만드는 데 사용할 수 있는 코드를 오픈 소스화했습니다. 회사에서는 Muse를 색상 E Ink 디스플레이에 로드하여 nhắc음을 표시하는 프로젝트, HDMI 스틱에 추가하여 큰 화면에서 Muse를 표시하는 프로젝트 등 다양한 아이디어를 제안합니다.

에이전트 2일 전

장기 언어_AGENT의 중량 꼬리 메모리 트레이스

장기 예측 언어 agent는 점점 더 외부 메모리를 세계 모델로 고정시키며, 현재의 메모리 시스템은 일반적으로 작업 성공률이나 토큰 비용만으로 평가됩니다. 우리는 메모리 사용의 형태가 누락된 것이며, 한정된 맥락과 반복적인 검색에서 agent 메모리는 작은 핵심에 집중할 수 있으며, 예측 오류가 축적되는 드문 상태를 긴 꼬리에서 남겨둘 수 있음을 주장합니다. 우리는 이 효과를 보존된 꼬리 감

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.