본문으로 건너뛰기

#멀티모달

106개의 기사

에이전트 4월 15일

스페이스 아틀라스: 공간 인식 연구 에이전트 벤치마크를 위한 컴퓨트 그라운드드 리즌

스페이스 아틀라스는 공간 인식 연구 에이전트 벤치마크를 위한 새로운 디자인 패러다임인 컴퓨트 그라운드드 리즌(CGR)을 소개합니다. CGR은 정해진 계산을 통해 모든 해결 가능한 서브 문제를 해결한 후 대규모 언어 모델에 질문을 보내는 방식입니다. CGR은 두 가지 도전적인 벤치마크를 처리하는 싱글 에이전트-투-에이전트(A2A) 서버로 구현되었습니다. 하나는 multimodal spatial question-answering 벤치마크인 FieldWorkArena, 다른 하나는 75개의 Kaggle 머신 러닝 대회를 포함하는 MLE-Bench입니다. 또한 이 시스템은 대규모 언어 모델(LLM)에 질문을 보내기 전에 정해진 계산을 통해 공간 정보를 추출하고 관계를 정의하는 구조화된 공간 장면 그래프 엔진을 사용합니다.

에이전트 4월 14일

오페플로: 시뮬레이션된 인간 웹 인터랙션을 통해 GUI 기반의 자동 UX 평가

오페플로: 시뮬레이션된 인간 웹 인터랙션을 통해 GUI 기반의 자동 UX 평가 웹 사용성 평가를 일반적으로 수행하려면 시간이 많이 걸리는 사용자 연구와 전문가 검토가 필요하며, 이로 인해 제품 개발 속도가 느려지며 특히 작은 팀과 안정적인 워크플로우에서 iteration 속도가 느려진다. 우리는 오페플로라는 사용자 경험 평가 에이전트를 제시하는데, 이는 사용자가 웹사이트에 접속하는 행동을 시뮬레이션하고 표준화된 사용성 평가를 제공한다. 전통적인 도구가 DOM 파싱에 의존하는 것과 달리, 오페플로

연구 4월 7일

표준화된 표 질문 답변을 위한 멀티모달 사고 최적화: TABQAWORLD

멀티모달 사고를 이용한 표 질문 답변을 위한 새로운 프레임워크인 TABQAWORLD을 소개합니다. 이 프레임워크는 표의 상태를 읽어내는 데 있어 텍스트 serialize의 오류를 줄이며, inference compute와 cost를 줄입니다. TABQAWORLD은 표의 동작을 jointly optimize하는 프레임워크로, representation과 estimation을 동시에 최적화합니다.

AI 모델 4월 6일

아우디오-비주얼 대규모 언어 모델은 정말 볼 수 있고 들을 수 있나요?

아우디오-비주얼 대규모 언어 모델(AVLLM)은 멀티모달 인식의统一된 인터페이스로 등장하고 있습니다. 연구진은 AVLLM의 내부 작동을 분석하여, 음성과 시각적 특징이 어떻게 중간 계층에서 결합하고, 최종 텍스트 출력을 생성하는지 밝혔습니다. 연구 결과, AVLLM은 중간 계층에서 풍부한 음성 의미를 인코딩하지만, 음성과 시각이 충돌할 때 최종 텍스트 생성에서 이러한 능력은 대부분 표출되지 않는다는 것을 발견했습니다.

인기 태그