본문으로 건너뛰기

#멀티모달

106개의 기사

AI 모델 5월 19일

TTE-Flash: Chain-of-Thought를 통해 멀티모달 표현을 가속화하는 '생각-그후-임베딩 토큰'

연구진은 Chain-of-Thought(CoT) 논리를 통해 Universal Multimodal Embedding(UME)의 성능을 크게 향상시켰다. 하지만 CoT를 생성하는 데 필요한 컴퓨팅 자원은 종종 부담이 된다. 연구진은 CoT를 생성하는 대신 latent think 토큰을 사용하여 CoT를 생성하는 것을 방지한다. 이 연구에서는 think 토큰과 임베딩 토큰을 추출하는 방법과 think 토큰과 임베딩 토큰을 학습하는 방법에 대한 두 가지 주요 아키텍처 디자인을 조사한다.

산업 5월 14일

크리에이티브 멀티모달 데이터 공급사 와이어스톡, 23억 달러 규모 투자 확보

크리에이티브 멀티모달 데이터 공급사 와이어스톡은 700,000 명 이상의 크리에이터를 보유한 플랫폼을 통해 AI 연구소에 사진, 비디오, 3D 콘텐츠를 공급하고 있습니다. 와이어스톡은 대규모 언어 모델(LLM)과 같은 AI 기술 개발을 지원하는 데 필요한 데이터를 제공하는 데 중점을 두고 있습니다.

LLM PC 5월 14일

다중 모드 히든 마르코프 모델을 이용한 지속적인 감정 상태 추적

대화의 감정 상태를 추적하는 것은 의료 및 임상적인 대화 상황에서 이해하고 대화의 지침을 줄 수 있는 중요한 요소입니다. 기존의 감정 인식 방법은 대화 단위로 작용하여 실제 대화 동적의 지속적인 단계를 숨기고 있습니다. 우리는 다중 모드 감정 표현을 이용하여 대화의 감정 상태를 지속적인 감정 상태로 모델링하는 가벼운 프레임워크를 제안합니다. 이 프레임워크는 지속적인 감정 상태를 추적하는 데 있어 가중치 요인 분산 혼합 모델-히든 마르코프 모델(Sticky Factorial HDP-HMM)을 이용합니다.

LLM PC 5월 13일

다중 모드 모델에 맞는 선택을 할 수 있을까? LatentRouter

대규모 다중 모드 언어 모델(LLM)의.espresso heterogeneous한 강점이 OCR, 차트 이해, 공간적 사고, 시각적 질문에 대한 답변, 비용, 지연 시간과 같은 다양한 태스크에 걸쳐 있습니다. 이에 따라 효과적인 다중 모드 모델 라우팅은 단순히 쿼리 난이도를 추정하는 것 이상의 작업을 필요로 합니다. 라우터는 현재 이미지-질문 입력의 다중 모드 요구 사항을 각 후보 모델의 능력과 매칭해야 합니다. LatentRouter는 대규모 다중 모드 언어 모델(LLM)의 라우팅을 카운터페이탈 다중 모드 유틸리티 예측으로 형식화하는 라우터를 제안합니다.

에이전트 5월 12일

건강관리 AI를 위한 성능 측정: 생성적, 다모드, 그리고 주체적 AI를 위한 벤치마크

건강관리 AI를 위한 성능 측정은 복잡한 실세계 워크플로우에서 신뢰성, 안전성, 및 임상적 중요성을 측정하는 체계적인 방법이 부족하다. 대부분의 벤치마크는 모델이 무엇을 알고 있는지 테스트하지만, 실세계 임상 작업의 전체 복잡성을 고려한 신뢰성과 실패를 테스트하는 벤치마크는 부족하다.

AI 모델 5월 12일

메모큐(MemQ): 자가진화하는 경험기억을 위한 Q러닝 통합

자연어 처리 대규모 언어 모델(LLM) 에서 경험기억을 축적하고 검색하는 것을 허용하지만, 현재의 방법은 각 기억을 독립적으로 평가하고 있기 때문에, 기억이 미래의 기억을 생성하는 의존성 체인에 대한 계산을 고려하지 못하고 있습니다. 메모큐(MemQ)는 TD(λ)가치 추적을 사용하여 기억 Q-값에 적용하고, 기억이 생성될 때 검색된 기억을 기록하는 증명성 DAG에 대한 후방 신호를 전파합니다. 신호의 가중치는 DAG의 깊이 d에 따라 (γλ)^d로 감소하고, 시간적 거리 대신 구조적 근접성을 사용합니다. 실험 결과, 6개의 벤치마크에서 메모큐(MemQ)는 일반화 평가와 런타임 학습에서 최고의 성공률을 달성했으며, 다단계 태스크에서 가장 큰 이익을 보였습니다.

연구 5월 12일

자동 평가 기준으로부터 Reward: 인간 선호도 구조를 명시적 다중 모드 생성 기준으로

대규모 언어 모델(LLM)의 선호도에 맞추기 위해 Reward Learning with Human Feedback(RLHF) 방법론이 사용되는데, 이러한 방법론은 인간의 선호도 구조를 스칼라 또는 쌍별 레이블로 축소시키는 문제를 가지고 있습니다. 이러한 문제를 해결하기 위해 Rubrics-as-Reward(RaR) 방법론이 제안되었지만, 이는 데이터 효율성과 확장성을 충족시키는 방법론이 아직 존재하지 않습니다. 이에 대한 해결책으로 Auto-Rubric as Reward(ARR) 프레임워크를 제안하였으며, 이는 Reward 모델링을 명시적 기준 기반 분해로 재정의합니다.

AI 모델 5월 12일

공간적 프라이밍이 의미적 프롬프트보다 우수하다: 차트 데이터 추출 정확성을 향상시키기 위한 격자 기반 접근법

과학 도표에서 데이터를 자동으로 추출하는 것은 대규모 문헌 분석에서 중요한 과제이다. 다모달 대규모 언어 모델(LLM)이 약속을 보여주지만 비표준화된 도표에 대한 정확도는 여전히 도전과제이다. 이로 인해 중요한 연구 질문이 제기된다: 의미적 프롬프트를 향상시키기 위한 모델 성능을 개선하는 가장 효과적인 전략은 무엇인가? 또는 저수준 공간적 프라이밍인가? 이 논문은 이 두 가지 DISTINCT 전략에 대한 비교적 연구를 제시한다. 우리는 의미적 방법론의 탐색적 실험, 두 단계의 메타데이터-첫 번

AI 모델 5월 8일

퍼지먼트: 인식이 이유에 얽힌 시퀀스적 결정을 위한 프레임워크

퍼지먼트 프레임워크는 시각-언어 모델(VLM)과 결정을 위한 대규모 언어 모델(LLM)을 동적으로 연결하여 시퀀스적 결정을 위한 새로운 접근 방식을 제시합니다. 이 프레임워크는 VLM의 묘사에 대한 LLM의 비판적 시각, VLM에 대한 목표 지향적인 질문, 그리고 간결한 이미지 묘사를 위한 합성과 같은 closed-loop 상호 작용을 통해 시퀀스적 결정을 위한 더 나은 이해를 가능하게 합니다.

LLM PC 5월 7일

Pro$^2$Assist: Long-Horizon Procedural Tasks를 위한 멀티모델 자존심적 인 인식과 함께 지속적인 단계적 인 예방적 지원

인공 지능이 지원하는 개인 보조기(Pro$^2$Assist) : 지속적인 단계 인식에 기반한 대비적 보조기와 멀티모달 에โก 센트릭 인식으로 인한 장기 절차적인 작업의 지원 장기 절차적인 작업은 일상 생활에서 흔히 볼 수 있는 작업들이다. 최근 대규모 언어 모델(LLM)의 발전으로 인해 일상 활동을 지원하는 개인 보조기들이 등장했다. 하지만 기존의 시스템들은 주로 사용자의 질의에 의해 트리거되는 반응적인 지침 제공 또는 격리된 단기 사건에 대한 제한적인 대비적 보조기 제공에 그치고 장기 절차적인

LLM PC 5월 7일

ADAPTS : 자동 프로토콜 - 증상 추적을 위한 에이전트 분해

감정 인식에서 부정적인 감정을 표현하는 임상적 추상 개념을 불특정 임상 상호 작용에서 모델링하는 것은 독특한 도전이다. 우리는 ADAPTS(대인적 분해를 위한 증상 추적에 대한 자동화된 프로토콜 무관 Framework, Agentic Decomposition for Automated Protocol-agnostic Tracking of Symptoms)라는 framework를 제시한다. 이 framework는 mixture-of-agents 대규모 언어 모델(LLM) 아키텍처를 사용하여 우울증과

AI 모델 5월 7일

사례에서 올바른 행동을 배우기 : 자율 에이전트에서 순차적 실행을 검증하기

자율적 에이전트의 순차적 행동을 검증하는 새로운 알고리즘을 제시했다. 이 알고리즘은 2-10개의 성공적인 실행 트레이스를 통해 올바른 행동을 자동으로 학습하고, 학습된 모델에 새로운 실행을 검증한다. 이 알고리즘은 컴파일러 이론의 도미네이터 분석 및 멀티모달 대규모 언어 모델-powered 의미 이해를 결합하여 필수 상태를 식별하고 비결정적 행동을 처리한다. 시스템은 Prefix Tree Acceptors를 사용하여 일반화된 ground truth 모델을 생성하고, traces를 다중 계층 적합성

AI 모델 5월 6일

구조된 지식에 기반한 LLM 기반 결함 분석 및 방지 지침 제공 시스템

이 연구에서는 LPBF를 대표하는 안전한 사례 연구로 LPBF 결함 분석 및 방지 지침을 제공하는 구조화된 지식에 기반한 LLM 기반 결함 분석 및 방지 지침 제공 시스템을 제안합니다. 이 시스템은 27 가지 LPBF 결함 유형을 포함하여 계층적 카테고리와 원인 관계로 조직된 지식베이스에 기반을 두고 있습니다. 이 시스템은 일반적인 목적의 시각-언어 모델과 비교하여 상당한 일치도를 나타내는 문법적 자연어 질의에 대한 지식의 체계적인 검색, 문헌에 근거한 결함의 설명, 인코딩된 프로세스 지식으로부터 결함의 원인과 방지 전략에 대한 지침을 제공합니다.

AI 모델 5월 4일

텍스트와 이미지에 대한 생각: 장기 시야 로봇 조작을 위한 교차된 시각-언어 추론 경로

장기 시야 로봇 조작을 위한 교차된 시각-언어 추론 경로 장기 시야 로봇 조작을 위해서는 논리적으로 일관되고 기하학적으로 기반을 둔 계획이 필요하다. 기존의 시각-언어-행동 정책은 계획을 잠재 상태에 숨기거나 하나의 모달리티만 노출한다. 텍스트만으로 구성된-chain-of-thought는 원인-결과 관계를 제시하지만 공간적 제약을 무시한다. 반면, 시각 예측은 기하학적 지시를 제공하지만 자주 지역적이고 의미적으로 제약적이다. 우리는 Interleaved Vision--Language Reas

AI 모델 5월 4일

대규모 언어 모델과 인간 선호도 조율을 위한 상위론 및 불확실성 인식 지향 디렉트 선호도 최적화

대규모 언어 모델(LLM)의 인간 선호도 조율을 위해 일반적으로 강화 학습으로부터 인간 피드백(RLHF)을 사용하거나, 더 단순하게 디렉트 선호도 최적화(DPO)를 사용합니다. 그러나 DPO는 선호도를 단순한 승자vs. 패자 신호로 다루고, 불확실성 또는 취약한 사고 체인으로부터 발생하는 노이즈 또는 가늘게 갈라진 선호도에 민감합니다. 우리는 상위론 및 불확실성 인식 지향 DPO의 변형인 TUR-DPO를 제안합니다. TUR-DPO는 DPO의 변형으로, 답변의 방법을 대신하여 답변의 내용을 보상하기 위해 가벼운 사고 체계를 유도하고, 의미적 충실성, 유용성 및 체계의 질을 조합하여 계측된 불확실성 신호로 조정합니다. 이러한 신호를 조합한 작은 학습 가능한 보상을 불확실성 가중치로 부여된 DPO 목표에 통합합니다. TUR-DPO는 RL-free이며, 고정 또는 이동 참조 정책에만 의존합니다. 실습 결과, 대규모 7-8B 모델과 다양한 벤치마크(수학적 사고, 사실적 질문 답변, 요약, 도움이 되는/해로운 대화)를 통하여 TUR-DPO는 DPO보다 심판 승률, 충실성 및 계측을 개선합니다.

AI 모델 5월 1일

개인화된 디지털 트윈을 통한 인지 쇠퇴 평가: 다원적 불확실성 인식 프레임워크

인간의 인지 쇠퇴는 매우 다양하여 예측, 임상试验 설계 및 치료 계획에 어려움을 겪고 있습니다. 연구팀은 개인화된 인지 쇠퇴 평가 디지털 트윈(PCD-DT)을 제안하여 환자별 질병 경로를 모델링하는 다원적 불확실성 인식 프레임워크를 개발했습니다. 이 프레임워크는 3개의 방법론적 구성 요소를 포함하여 환자별 시간적 동적을 표현하는 감추어진 상태-공간 모델, 임상, 생물학적, 영상 특성의 다원적 융합, 그리고 강인한 디지털 트윈 작동을 지원하는 불확실성 인식 유효성 검사 및 적응 업데이트라는 세 가지 구성 요소를 포함합니다.

연구 5월 1일

MCI에서 AD로의 전환 예측을 위한 TabPFN: 데이터 제한된 환경에서

약한认知장애(MCI)에서 알츠하이머병(AD)으로의 전환 예측은 조기 개입에 필수적이지만, 데이터가 제한된 환경에서 신뢰할 수 있는 전환 예측 모델을 개발하는 것은 어렵다. 본 연구에서는 TabPFN을 사용하여 TADPOLE 데이터셋에서 3년간의 MCI에서 AD로의 전환을 예측하는 데 사용되었다. 다중 모드 생체 표지자 특성을 사용하여 학습 모형을 비교하고, XGBoost, Random Forest, LightGBM, Logistic Regression과 같은 전통적인 기계 학습 방법에 비해 TabPFN의 성능을 평가하였다.

에이전트 5월 1일

GUI 자동화 에이전트의 효율적인 사용을 위한 단계 수준 최적화

GUI 자동화 에이전트는 컴퓨터 소프트웨어 자동화의 유망한 방식으로, 그래픽 사용자 인터페이스와 직접 상호 작용할 수 있기 때문에 brittle한 애플리케이션 특정 통합에 의존하지 않습니다. 그러나 최근 성능 벤치마크에서 강력한 GUI 자동화 에이전트는 실제로 비용이 많이 들고 느려질 수 있습니다. 이 문제의 원인은 GUI 작업의 오랜 수직에서 대규모 멀티 모달 모델을 거의 모든 상호 작용 단계에서 호출하는 것입니다. 우리는 이러한 uniform한 컴퓨팅 할당이 GUI 작업의 오랜 수직에서 효율적이지 않다는 것을 주장합니다. 이러한 경로들은 매우 다양합니다: 많은 단계는 일상적이고 신뢰할 수있는 작은, 저렴한 정책으로 처리할 수 있습니다. 그러나 오류는 상대적으로 작은 수의 고위험 순간에 집중됩니다. GUI 자동화 벤치마크에서 이러한 실패는 두 가지 형태로 반복됩니다: 진행이 고정되면 에이전트는 루프, 반복적 인 비효율적인 동작, 또는 의미 있는 진행을 하지 못할 때, 그리고 침묵된 의미 드리프트는 에이전트가 이미 사용자의 실제 목표에서 벗어나지만 현지적으로 합리적인 동작을 계속하는 경우입니다. 이 문제를 해결하기 위해, 우리는 GUI 자동화 에이전트를 위한 이벤트 기반, 단계 수준의 계단을 제안합니다. 이 계단은 작은 정책을 기본으로 하며, 가볍게 학습된 모니터가 고위험을 감지할 때만 강력한 모델로 전환합니다.

에이전트 4월 28일

이야기 TR: 내러티브 중심 비디오 시간적 검색에 대한 이론적 사고의 논리

현재 비디오 순간 검색은 행동 중심적인 작업에 뛰어나지만 내러티브 콘텐츠에 어려움을 겪고 있습니다. 모델은 \textit{무엇이 일어나고 있는지}를 볼 수 있지만 \textit{왜 그것이 중요하게 여겨지는지}를 이유하지 못합니다. 이 의미의 격차는 표면 수준의 관찰에서 암시적 의도, 정신 상태 및 내러티브의 인과성을 추론할 수 있는 \textbf{이론적 사고 (ToM, Theory of Mind)}의 부족으로부터 유래합니다.

AI 모델 4월 23일

임상시험 문헌에서 투여 오류 자동 감지: LightGBM을 사용한 다중 모드 특성 엔지니어링 접근법

임상시험 문헌에서 투여 오류 자동 감지: LightGBM을 사용한 다중 모드 특성 엔지니어링 접근법 임상시험에서는 약물 사용 프로토콜에 엄격히 따르지만 투여 오류는 여전히 환자 안전과 시험의完整성을影响하는 지속적인 도전으로 남아있다. 우리는 gradient boosting을 사용하여 comprehensive multi-modal feature engineering을 통한 unstructured clinical trial narratives에서 dosing errors를 자동 감지하는 시스템을

인기 태그