본문으로 건너뛰기

#멀티모달

106개의 기사

AI 모델 7월 20일

메모에서 유해한 웃음을 감지하고 설명하는 다각적인 사고:

인터넷 메모는 시각적 단서, 텍스트 콘텐츠, 그리고 문화적 배경을 함께 조합하기 때문에, 이중 의미와 해괴함이 함께 존재하는 상황에서는 특히 해석하기 어려운 것이다. 이러한 복잡성을 고려할 때, 정확한 분류와 인간이 이해할 수 있는 설명을 제공하는 설명 가능한 메모 이해 시스템이 필요하다. 그러나 기존의 다모드 분류기는 이러한 상호 의존성을 무시하거나 해석 가능성을 제한적으로 제공한다. 이

AI 모델 7월 20일

건설 도면에서 다중 깊이 시각-문서적 추론을 위한 실제 세계 벤치마크: DrawingVQA

DrawingVQA라는 새로운 벤치마크를 소개합니다. 이 벤치마크는 대규모 언어 모델(LLM)들을 실세계의 건설 도면에 대한 멀티 모달 평가에 사용하기 위해 설계되었습니다. 건설 도면은 건축, 토목, 그리고 여러 다른 공학 분야에서 핵심적인 미디어입니다. 자연 이미지나 스키마틱 플랜과 달리, 건설 도면은 추상적인 기하학, символ 표기법, 표 형식의 데이터, 주석, 그리고 특정 분야의 텍

AI 모델 7월 13일

진짜 세계의 의료 멀티모달 벤치마크: 중국 온라인 의료 상담

대규모 언어 모델(LLM)들이 점점 더 많이 온라인 의료 상담에 도입되고 있지만, 현재까지의 벤치마크들은 실제 의료 실무와 잘 맞지 않는다. 많은 벤치마크들은 합성 대화나 환자 시뮬레이터를 사용하거나, 환자 업로드 한 의료 사진을 무시하거나, 다중 선택 또는 의미적 겹침 지표를 사용하여 개방된 의료 응답을 평가한다. 이는 의료 질을 잘 반영하지 못한다. 우리는 진정한 세계의 멀티모달 온라인 의료 상담을 위한 대규모 벤치마크인 **MedRealMM**을 소개한다. MedRealMM은 전국 중국 인터넷 병원에서 수집한 비식별 환자-의사 상호 작용을 사용하여 멀티모달 온라인 의료 상담을 위한 벤치마크를 구축한다. MedRealMM은 멀티모달 의료 문제 해결 지점(MCCP) 추출 Framework를 사용하여 진정한 상담 경로에서 의료적으로 요구되는 순간을 식별하고, 이전 텍스트-이미지 컨텍스트를 보존하는 동안 각 순간을 표준화된 다음 응답 생성 과제로 변환한다. 각 인스턴스는 의사들이 정제한 경우별 규칙을 사용하여 환자-의사 상호 작용을 평가한다. 현재 릴리즈에는 5,620개의 진정한 세계의 멀티모달 사례가 포함되어 있으며, 64개의 의료 부서를-spanning한다. 우리는 19개의 일반 목적 및 의료 전문 LLM, 텍스트-이미지 시스템을 포함하여 LLM을 평가한다. 결과는 이미지 정보가 신뢰할 수 있는 의료 성능을 보장하는 데 중요하며, 현재 최첨단 모델들이 온라인 의사 응답을 만족시키지 못한다는 것을 보여준다.

에이전트 7월 13일

장기 목표 지표 벤치: 장기 목표 지표를 위한 분자 보상 평가를 위한 agent의 한계를 시험하는

인공지능 agent는 짧고 명확한 작업을 자율적으로 완료할 수 있게되었습니다. 그러나 현재의 종결 벤치점은 간단한 문제에 초점을 맞추고 1분 이내에 완료되며, 최종 결과만 평가하는 것이 일반적입니다. 이러한 설정은 중간 진행과 부분적인 해결책을 무시하고, 희박한 보상 신호와 agent의 능력을 완전히 이해하지 못하게 합니다. 장기 목표 지표 벤치를 통해, 우리는 9개의 카테고리 (실험 재현, 소프트웨어 공학, 멀티 모달 분석, 인터랙티브 게임, 과학적 계산)로 구성된 46개의 장기 목표 지표 작업을 소개합니다.

AI 모델 7월 10일

무한 파서2 기술 보고서

Infinity-Parser2는 대규모 다중 모드 모델로, 데이터 합성을 위한 제어 가능한 pipe라인과 다중 목표 강화 학습을 통해 문서 파싱을 끝까지 수행하는 시스템입니다. 우리의 기여는 세 가지로 나뉩니다. 첫째로, 우리는 대규모 데이터 합성을 위한 스케일러블한 엔진을 만들었습니다. 이 엔진은 제어 가능한 렌더링 프레임워크와 반복적인 개선 루프를 pairing하여, 5백만 샘플의 이중

AI 모델 7월 7일

iFLYTEK-인체와 상호작용하는 모든 기술 보고서

대규모 언어 모델(LLM)과 같은 일반적인 몸체 있는 agent는 다중 모드 지시를 이해하고, 환경이 어떻게 진화할 것인지 예측하고, 장기적인 시야에서 정확한 제어 액션을 생성해야 합니다. 기존 접근 방식은 일반적으로 시각-언어 추론, 비디오 기반 월드 모델링, 또는 액션 생성에 특화되어 있으며, 관찰을 미리 합성하고 나서 액션을 추론하는 계열 pipeline가 인터페이스 병목 현상을 유발하

연구 6월 30일

비전-언어 모델의 테스트 시간 적응을 위한 보완 메모리 시스템: ComMem

시각-언어 모델(Vision-Language Models, VLMs)의 강력한 배포를 위해 테스트 시간에 적응(Test-time adaptation, TTA)이 필수적이다. 그러나 기존의 TTA 방법들은 대개 시간에 걸쳐 지식을 축적하거나 단일 모드 내에서 작동하는 경우가 많아 시각-언어 모델의 내재된 다중 모드 특성을 활용하지 못한다. 생물학적 뇌의 보완적 기억 시스템을 참고로 하여, 우리

연구 6월 30일

COMPASS: 통합 멀티모달 모델에서 구성-의도 지침을 기반으로 하는 지지

composition은 높은 수준의 시각적 의도입니다. 이 의도는 주체가 어디에 위치하고景면이 어떻게 조직되는지에 관해 규정합니다. 그러나 현재의 통합 멀티모달 모델은 세부적인 composition 인식에 대해 불신할 정도로 불안정하고 이러한 의도를 제어할 수 있는 생성을 힘들게합니다. 우리는 COMPASS를 제시합니다. COMPASS는 perception과 generation을 모두 포함하

LLM PC 6월 30일

다중 모드 LLM의 이미지 기반 의료 대화에 대한 벤치마크

최근 대규모 언어 모델 및 시각-언어 모델의 발전으로 다중 모드 데이터에 대한 논리적 추론이 가능해졌고, 의료 적용 분야에서 의사결정 지원 및 전문의로의 분류와 같은 기회를 제공하고 있습니다. 그러나 현재 의료 AI 벤치마크는 분산되어 있습니다: 일부는 다중 턴 대화 지원을 제공하지만 이미지를 제공하지 못하고, 다른 벤치마크는 다중 모드 입력을 제공하지만 단일 턴 QA 작업에만 집중하고 있습

에이전트 6월 30일

GPTNT: 실시간 멀티모달 agent 간 협업을 위한 'Keep Talking And Nobody Explodes' 벤치마크

인공지능이 인간이나 다른 인공지능과 협력하여 작업을 수행하는 데 사용되는 다중 모드 모델의 사용이 점점 증가하고 있습니다. 현재 기준의 벤치마크는 이러한 모델이 여러 구성 요소의 능력을 갖추고 있음을 보여주지만 협력 시 발생하는 시간 압박, 정보 비대칭성 및 불완전한 통신과 같은 조건은 일반적으로 분리된 상태에서 연구됩니다. 우리는 협력하는 두 개의 agent가 반응 시간 내에 생성된 폭탄

에이전트 6월 29일

증명 가능한 기하학 문제 해결: 해결책에 따라 자동 공식화 및 정리 제안

지오메트리 문제 해결은 최근 뉴로-symbolic 패러다임을 채택하고 있는 추세입니다. 이 패러다임은 신경망의 직관성을 symbolic rigor와 결합하는 방식입니다. 그러나 현재의 프레임워크는 두 가지 핵심 단계에서 심각한 병목 현상을 겪고 있습니다. 첫 번째는 autoformalization, 즉 멀티모달 번역을 static task로 다루고 downstream solver compat

AI 모델 6월 29일

몸을 가진 계획에서 ẩn상태 사회 규범 준수에 대한 기준점: NormAct

대규모 멀티모달 언어 모델(LLM)은 점점 더 embodie된 계획자로 egocentric 환경에서 사용되고 있다. 이러한 환경에서 성공적인 작업은 수행한 명령에 달려 있으면서도 사회적으로 적절한 방식으로 행동하는 것이 중요하다. 명확한 목표는 특정 행동을 최적화하는 데 도움이 될 수 있지만, 암묵적인 사회적 규범은 숨겨진 제약을 가질 수 있다. 기존의 평가 방법은 주로 명확한 목표 달성을

AI 모델 6월 29일

멀티모달 감정 합리화: 느린 빠른 사고 협동으로

explicit 추론이 반드시 더 나은 다중 모드 감정 인식(Multimodal Emotion Recognition, MER) 정확도에 직결되지 않는다는 것을 발견했습니다. 추론 기반 대규모 언어 모델(LLM)에서, 빠른 사고를 유발하여 직접적인 대답을 트리거링하는 것이 종종 느린 사고 후 철저한 추론보다 성능이 뛰어난 경우가 많습니다. 실증 분석 결과, 빠른 사고는 더 넓고 더 자신 있는

LLM PC 6월 26일

다중 모드 LLM 평가에서 놓치고 있는 것

대규모 다중 모드 언어 모델(Multimodal Large Language Model, MLLM)은 다양한 입력을 처리하고 텍스트 응답을 생성할 수 있다. 예를 들어, 텍스트, 이미지, 음성, 비디오 등이다. 이러한 모델의 기능은 급격히 발전하고 있지만 평가에는 그에 맞는 속도는 유지되지 않고 있다. 대부분의 기존 평가 기준은 단일 작업에만 제한되어 있으며, 모델이 모드 간 정보를 통합하는지

에이전트 6월 24일

모든 경로: Wheelchair 접근성 감사에 대한 다중 모드 적극적 프레임워크

wheelchair 사용자는 일반적인 지도에서 blue색 라인이 종종 깨진 약속으로 나타난다. OpenStreetMap (OSM)과 같은 플랫폼은 도로의 위치를 성공적으로 캡처하지만, 그것을 여행하는 물리적인 느낌을 전달하는 데 자주 실패한다. 이 정보 격차는 wheel chair 사용자에게 문제이다. 이 문제를 해결하기 위해 우리는 OmniPath라는 시스템을 제시한다. 이 시스템은 지도를

에이전트 6월 24일

실제 언어의 다국어 다이얼로그 이미지 부정 확인을 위한 멀티모달 부정 정보 탐지

바이럴 게시물은 이제는 장문의 다언어 문장, 여러 이미지, 혼합된 출처, 그리고 텍스트와 이미지의 서술 오류를 포함하는 것이 더 많아지면서, 다중 모드 정보 오류 탐지의 중요성이 점점 더 커지고 있습니다. 현재의 기준점과 방법들은 여전히 이 환경에 잘 맞지 않고 있습니다: 일반적으로 짧은 캡션, 단일 이미지, 이진 레이블, 또는 하나의 조작 소스를 분리하는 경향이 있습니다. 또한, 현실적인

AI 모델 6월 19일

REVEAL++: 알츠하이머병 위험성에 대한 시각-언어 망막 모델링을 위한 유연한 유기체 그룹화

retina를 통해 뇌 질환의 비침습적 관찰 창을 열 수 있으며, 미세한 구조 패턴을 통해 미래의 cognitive 하락 위험이 있는 사람을 식별할 수 있다. REVEAL과 같은 vision-language alignment 프레임워크는 retinal fundus 이미지를 구조화된 clinical risk narratives와 Pairing하여 Alzheimer's disease (AD) 예

AI 모델 6월 18일

부분적으로 관찰 가능한 환경에서의 이동 계획에 대한 생성 모델 예측 계획

무장관측 환경에서 tự율적 에이전트가 효과적인 의사결정을 하기 위한 어려움을 해결하기 위해, 학습된 신경망을 이용한 믿음 공간의 근사치를 이용하는 믿음 기반 방법은, 특히 높은 차원에서 인식 상동성을 포함한 믿음 공간의 내재적 다중모달성 captures를 실패한다. 그 동안 생성 모델은 대량의 데이터 또는 전문가 시연이 필요하며 장기 계획에 대한 명시적 메커니즘을 제공하지 않는다. 이 논문에

AI 모델 6월 18일

NAVI-Orbital: 자율 천문 관측을 위한 초보 반영구적 시각-언어 모델의 첫 우주 데모

지구 관측 데이터의 생성 속도와 지상에서 사람이 참여하는 처리 속도는 지구 관측 데이터를 다운받는 대역폭과 지구 관측 데이터를 분석하는 속도 사이의 격차를 만들고 있다. 이 논문은 NAVI-Orbital이라는 소프트웨어 시스템을 Low Earth Orbit(Low Earth Orbit, LEO) 위성에 배치한 것이다. 2026년 4월 16일, NAVI-Orbital은 대규모 언어 모델(LLM

AI 모델 6월 16일

모델링에서 시간까지 고려하는 이벤트 모델링을 위한 크로스 모달 표현 대응

accurate 시간까지 발생하는 예측(TTE)은 멀티모달 클리닉 데이터에서 어려움을 겪고 있습니다. 이는 모달 불균형과 분포 shift로 인해 발생합니다. 우리는 CT 영상과 연속적인 EHR 데이터 사이의 모달 대응을 위한 foundation model-기반 프레임워크를 제안합니다. 이 프레임워크는 여러 작업과 기관에서 일반화가 가능합니다. CT와 EHR 모달리티는 각각 domain-spe

에이전트 6월 16일

컴퓨터 사용 에이전트의 안전성 평가를 위한 벤치마크

컴퓨터 사용을 위한 agent의 평가가 점점 더 현실적인 데스크톱과 웹 작업을 완수하는지 여부로 이루어지고 있습니다. 그러나 작업의 성공만으로는 agent가 안전하지 않은 단축 경로를 통해 목표를 달성하는 실패를 놓치게 됩니다. 우리는 OSGuard라는 안전성을 평가하는 데 사용되는 컴퓨터 사용 agent의 이중 granular benchmark suite를 소개합니다. OSGuard는 사용

인기 태그