본문으로 건너뛰기

#멀티모달

106개의 기사

AI 모델 2일 전

듀얼 엔트로피 강화 정책 최적화: MLLMs에서 환상 생성을 위한

강화 학습(RL)은 멀티모달 대규모 언어 모델(LLLM)의 추론을 더 명확하게 만들기 위해 널리 사용되지만, 오류의 위험성이 가장 높은 곳에서 오류가 발생하는 것을 방지하는 효과는 균일하지 않다. 이는 보상에서 매개변수 업데이트로의 수정 chain에서 두 개의 약점으로 인한 것이다. rollout 단계에서, 의미론적 엔트로ピー가 높은-hard 쿼리---그것들은 단결적으로 잘못된 샘플 그룹을

연구 3일 전

스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion

스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.

AI 모델 3일 전

유니버설 오모드 임베딩의 경계를 확장하는 오비스 임베딩

이 연구에서는 **Ovis-Embedding**이라고 부르는 cutting-edge의 모든 모드(omni-modal) 임베딩 패밀리를 소개합니다. 이 임베딩은 텍스트, 이미지, 비디오, 오디오를 포함하는 원시 통합에 기반합니다. 기존의 임베딩은 각 모드별로 별개의 모드 탑(tower)을 구성하는 대신, Ovis-Embedding은 공통된 다모드 백본(backbone)을 사용하여 다중 모드 데

AI 모델 3일 전

GBM 생존 예측을 위한 정확하고 해석 가능한 하이퍼 그래프 신경망

GBM의 생존 예측은 정확하고 해석 가능한 모델을 요구하지만 현재의 접근법은 이 두 가지 목표를 경쟁적으로 다루고, 성능이 좋은 모델은 투명성을 포기하고, 해석 가능한 모델은 예측 능력을 희생한다. 우리는 이 트레이드 오프가 본질적인 것은 아니라고 주장한다. 그래프 신경망은 구조적 기초를 제공하여 해석 가능한, 설명 가능한 표현을 추출할 수 있다. 또한 현재의 방법은 일반적으로 단일 이미지

LLM PC 9월 17일

지오AI를 위한 지식형 언어 모델(LLM) 지원 GIS에 대한 윤리적 및 개인정보 보호 위험에 대한 서술적 검토: 자율 GIS를 위한 통치 aware GIS의 방향

지오스페이셜 인공지능(GeoAI)은 대규모 언어 모델(LLM)으로 구동되는 자연어 인터페이스와 자율 GIS 워크플로를 통해 공간 정보에 대한 쿼리, 생성 및 해석 능력을 확장하고 있다. 이러한 기능은 일반적인 인공지능 윤리 논의에서 다루지 못하는 정부에 대한 새로운 도전을 제기한다. 이는 이동성 추적에서 수동 위치 추론, 공간적으로 구조화된 편견의 증폭, 공간적 자율성의 증폭, 다중 모드 지

AI 모델 9월 15일

시계열 언어 모델에서 합성적 사고를 유도하는 시간 생각:

타임 시리즈 멀티 모달 대규모 언어 모델(TS-MLLMs)은 최근 대규모 언어 모델(LLMs)의 추론 능력을 활용하여 질문-답변 작업을 수행하기 시작했습니다. 그러나 이러한 모델들은 종종 동적 시간 패턴을 포착하지 못하고, 고위험 응용 프로그램인 의료와 같은 경우에는 암시적 추론만 제공하여 중요한 설명을 제공하지 못합니다. 반복 학습(RL)-기반 타임 시리즈 언어 모델은 이러한 문제를 해결하

연구 9월 14일

전체 심장의 읽기: 중첩-주의 방지 가면 자기 인코더를 이용한 다중 모드 심장 표현 학습

심장 질환의 진단은 ECG, 초음파 카디오그래피, 흉부 엑스레이, 임상 변수 등 각기 다른 부분이지만 상호 관련된 심장 생리학의 측면을 포괄하는 다양한 방법들을 통합하는 것으로 나아간다. 그러나 대부분의 의료 기초 모델은 모드별로 구분되어 있으며, 대부분 모드별로만 학습이 진행되어야 한다. 이러한 방법은 임상진료사들이 자연스럽게 통합하는 교차 모드 증거를 무시하고, 각 모드 내의 구조를 무시

허깅페이스 9월 7일

네오엠엠이: 효율적인 다중 모드-본연 및 다언어 인코더

Meta는 AI 연구를 위한 새로운 연구 센터를 설립했습니다. 이 센터는 Meta의 AI 연구를 집중적으로 지원하기 위해 설립되었습니다. 센터는 Meta의 연구자와 연구를 함께할 수 있는 연구자, 개발자, 엔지니어 등 다양한 직군의 사람들을 모을 계획입니다. Meta는 AI 연구를 위한 새로운 연구 센터를 설립했습니다. 이 센터는 Meta의 AI 연구를 집중적으로 지원하기 위해 설립되었습니다

AI 모델 9월 7일

기업 언어 모델(Corporate Language Model, CLM): 암묵적이고 분산된 기업 지식과 기업 지식层를 형성하는 소유권 있는, 감사 가능한, 실행 가능한 기업 지능 layer로의 변형

기업의 AI 도입이 모델의 한계로 실패하지는 않지만, 대규모 언어 모델(LLM)은 특정 기업의 개념적 전제(prior)들을 담지 않고 있으며, RAG(Retrieval-Augmented Generation)은 실행 가능한 행동의 길을 열지 못하고 있으며, 정적 플레이북(static playbook)은 논리를 표현할 수 있지만, 논리를 표현하거나 적응할 수는 없다는 문제점이 있다. 이러한 요구

에이전트 9월 6일

GUI 에이전트는 언제 행동하지 않아야 할까요? GUI 에이전트의 충돌 인식과 종료를 위한 새로운 접근 방법

GUI 에이전트는 점점 더 자연어 명령을 사용하여 사용자 인터페이스를 조작하는 데 사용되고 있습니다. 그러나 실제 사용자는 불필요한 명령을 내리게 되며, 이는 에이전트가 행동하는지 아닌지 알 수 있도록 해야 합니다. 새로운 연구에서는 CONFLICTGUI라는 새로운 벤치마크를 제안하여 에이전트가 충돌 인식과 종료를 위한 새로운 접근 방법을 제안합니다.

LLM PC 8월 10일

중간 층의 주의 집중 예측을 통해 시각 토큰 압축

대규모 멀티모달 언어 모델(Multimodal Large Language Model, MLLM)의 효율성을 향상시키기 위해 시각 토큰 압축을 사용하는 방법을 제안합니다. 이 방법은 중간 언어 모델 층의 주의 집중을 예측하여 시각 토큰의 중요도를 평가합니다. 이 방법은 existing inference acceleration techniques와 호환되며, 10개의 benchmark에서 97.5%의 unpruned model 성능을 유지하며, 5.56%의 시각 토큰만 사용하여 3.09배의 end-to-end speedup을 달성합니다.

AI 모델 8월 6일

테이블에서 멀티모달 보고서 생성을 위한 몬테 카를로树 탐색

데이터 지능의 중요한 문제 중 하나는 구조화된 표 데이터에서부터 BOTH 텍스트 분석과 시각화 차트를 포함하는 전문적인 멀티모달 보고서를 자동으로 생성하는 것입니다. 현재 방법론은 고정된 선형 PIPELINE과 분리된 SUBTASK PROCESSING으로 인해 사실의 정확도, 시각적 품질, 그리고 논리적 일관성을 동시에 최적화하는 것을 방해하고 있습니다. 이러한 문제를 해결하기 위해, 이 논

에이전트 8월 3일

ViSAGE: 오랜 기간의 비디오 이해를 위한 자가 수정 가능한 기억을 구축하기

장기 시각적 환경에서 동작하는 멀티모달 에이전트는 엔티티에 대한 일관된 temporally grounded(시각적으로 정해진) 추론을 지원하기 위해 multimedia memory를 생성하고 지속적으로 업데이트해야 합니다. 그러나 현재의 에이전트 메모리 접근법은 강력한 압축과 segment-wise processing에 의하여 fine-grained identity cues를 버리며, 벡터

LLM PC 7월 31일

사회적 추론 게임을 위한 의사결정 인공지능

AI agent가 참가하는 사회적 판단 게임(Social Deduction Games, SDGs)인 Werewolf와 같은 게임은 인공지능 agent를 위한 새로운 시험 장치로 변해 갔다. 이러한 게임은 복잡한 사회적 능력인 논리적 사고, 거짓말, 협력 등이 필요하다. 최근 대규모 언어 모델(LLM)의 발전으로 SDG agent의 성과가 크게 향상되었지만, 현재의 접근 방식은 주로 텍스트 기

에이전트 7월 31일

장기 의료 멀티모달 데이터 과학을 위한 장기 시각화 코딩_AGENT

클리니컬 데이터 사이언스 에이전트는 다차원 longitudinal 기록을 분석할 수 있는 신뢰할 수 있는 결과로 변환해야 하지만, 기존 벤치마크들은 주로 의료 질의응답, 구조화된 표 정리, 또는 일반 과학 데이터베이스만 다루고 있다. 우리는 CLINLENS라는 새로운 벤치마크를 소개한다. CLINLENS는 구조화된 전자 의료 기록, 의사소통 기록, 전기 심장 그래프, 흉부 방사선 사진, 그리

에이전트 7월 29일

엣지 환경에서 인간이 참여하는 프로세서적 작업 안내를 위한 에이전트 프레임워크: ProcAgent

기계가 사람과 함께 작업하는 방식을 돕는 새로운 시스템을 개발했습니다. 이 시스템은 가구 조립이나 집 수리 같은 복잡한 작업을 돕는데 사용됩니다. 이 작업을 하는 동안 사용자는 지시를 이해하고 작업의 진행 상황을 추적하며 공간 상태를 생각하고 오류를 복구해야 합니다. 이전의 멀티 모달_assistant_ 시스템은 지시를 제공하는 데 도움이 되었지만 대부분의 시스템은 클라우드에서 추론을 수행하

LLM PC 7월 27일

다양한 모드의 인공지능을 위한 내부 정보 분해를 통한 보안

다중 모드 대규모 언어 모델은 단일 모드 시스템에 없는 공격 표면을 제공합니다: 공격자는 단일 모드 보안을 우회하기 위해 악의적인 의도를 모드에 분산시킬 수 있습니다. 이에 따라 각 모드를 분리하여 검사하는 대신, 모드 간 일관성을 검사하여 공격 탐지 신호로 사용하는 것이 적절합니다. 우리의 주요 관찰 결과는, 양성 입력은 텍스트만 사용하고 시각만 사용하는 논리적 추론에서 호환되는 예측 행동

AI 모델 7월 24일

의학 텍스트에서 LLM 워터마크의 오류: 의료 성능 평가

의학 텍스트에서 대규모 언어 모델(LLM)의 워터마크가 의료 성능에 미치는 영향을 조사한 연구가 발표되었습니다. 연구 결과, 워터마크가 의료 텍스트의 의미를 바꾸거나 의학적 오류를 유발할 수 있음을 발견했습니다. 이러한 결과는 의학 분야에서 워터마크를 안전하게 사용하기 위한 새로운 평가 기준을 제시합니다.

연구 7월 21일

다중모달 그래프 RAG를 위한 후기 상호작용 증거 검색: ColGraphRAG

대규모 언어 모델(LLM)에서 그래프와 관련된 멀티모달 질의응답 시스템을 개선하기 위해, 우리는 그래프에 연결된 이미지 노드에 대한 시각적 후보 랭킹 연산자를 ColBERT/ColPali 계열의 Late-Interaction MaxSim-style 다중 벡터 스코링으로 교체했습니다. 이 변경은 멀티모달 QA에서 그래프에 연결된 이미지 후보에 대한 검색 단계 점추정치가 향상되고, 시각적 증거가

AI 모델 7월 20일

LEED 준수를 위한 신경symbolic 인공지능: 문서 중심 벤치마킹, 결정론적 숫자 검증, 그리고 멀티모달이 왜 해를 끼치는지

LEED v4.1 BD+C 인증은 아직도 문서 집약적인 프로세스로, 검토자들은 수백 페이지의 프로젝트 증거를 읽고 수동으로 크레딧-특정閾치 논리를 적용해야 한다. 이 연구에서는 작고 지역적으로 구축된 언어 모델들이 LEED 문서의 의미 있는 필터링을 수행할 수 있는지, 그리고 결정론적 Symbolic 구성 요소들이 그 작업을 공유하는 방식이 무엇인지 조사한다. 프로젝트 PDF를 LEED 크레

AI 모델 7월 20일

MLLM-유도 diffusian 변환기와 관계 적응 혼합 전문가 모델을 이용한 다모드 지식 그래프 완성

Multimodal 지식 그래프 완성(Multimodal Knowledge Graph Completion, MKGC)은 구조적, 텍스트, 시각적 단서에서 누락된 엔터티를 추론하는 것을 필요로 한다. 기존의 확산 기반 MKGC 방법은 일반적으로 raw multimodal 특징에 직접 노이즈 제거를 한다. 이러한 디자인은 관계에 의존하는 단서 선택, 교차 모드 의미 부합, 구조적 엔터티 생성을

인기 태그