본문으로 건너뛰기

#멀티모달

106개의 기사

연구 6월 16일

의미강화된 검색 보강 시계열 예측

시계열 예측 모델은 역사적인 패턴에서 많은 이점을 얻습니다. Retrieve-Augmented Generation(RAG)에서 영감을 받아 최근 연구에서는 시계열 예측을 향상시키기 위해 관련된 역사적인 시계열 구간을 검색하는 것을 탐구했습니다. 그러나 비stationarity 하에서만 시계열 유사성을 단지 의존하는 것은 종종 충분하지 않습니다. 이를 해결하기 위해 우리는 멀티모달 접근을 제안

에이전트 6월 11일

금융 및 수치 연산 reasoning을 위한 Market-of-Claims Code Agent: MoCA-Agent

금융 및 표 형식 질문에 대한 답변은 유창한 논리만으로는 충분하지 않다. 답변은 정확한 사실, 공식, 단위, 부호 및 척도를 기반으로 하여야 한다. 단일 잘못된 행 또는 잘못된 연산이 조용히 합리적인 하지만 오류인 결과를 생성할 수 있다. 우리는 \textsc{MOCA-Agent}라는 시장의 요구 사항에 따라 코드 에이전트를 소개한다. 이 시스템은 자유 형식의 다중 에이전트 토론을 claim

LLM PC 6월 10일

감각부터 결정을 내리는 과정: 다중 모드 LLM에서 청각과 시각 인식 정보 흐름

멀티모달 대규모 언어 모델(Multimodal Large Language Models, MLLMs)은 들을 수 있고 보이도록 만들 수 있지만, 실제로 음성과 시각적 신호가 어떻게 네트워크를 통해 답변을 형성하는지 알기 어렵습니다. 연구와 실세계 응용에서 그 역할이 점점 커지면서도, 음성과 시각적 토큰이 최종 예측에 어떤 영향을 미치는지에 대한 내부 경로가 아직까지도 잘 이해되지 않은 상태입니

연구 6월 9일

다양한 모드의 논리적 추론을 향상시키기 위한 최악 차원 최적화

다중 모드 추론은 시각적 기반에서 논리적 일관성까지 광범위한 제약 조건을 유지하는 경로를 필요로 한다. 그러나 현재 프로세스 보상 모델은 이러한 요소들을 균등하게 가중치 부여하는 규칙적으로 정의된 보상을 중점으로 두고 있다. 이는 주요 요소에 의해 지배되는 개별 차원 실패를 은폐할 수 있지만, 일반적으로 추론 프로세스의 유효성을 보장하지는 않는다.

에이전트 6월 9일

개방형 소스 개인 자동화 및 단일 인터페이스跨 플랫폼 실행

개인용 AI agent는 API, 셸, 웹 표면, 데스크톱 GUI와 같은 다양한 인터페이스에 걸쳐 작동해야 하지만 많은 시스템은 여전히 단일 인터페이스에 맞춰져 있고 사용자 교육 및 감사성에 대한 지원이 제한적이다. 우리는 Syll이라는 오픈 소스, 자체 호스팅 멀티 모달 agent harness를 제시한다. Syll은 MCP/API 도구, CLI 실행, 그리고 모듈러 런타임 내에서 시각적

에이전트 6월 9일

병리학에서 다중 출처 증거 심사 방식을 위한 경험이식된 작위적 워크플로우 방향으로의 PathoSage

최근 다중 모드 대규모 언어 모델(Multimodal Large Language Models, MLLMs)과 agent 워크플로우의 발전은 컴퓨터 병리학에 대한 강력한 가능성을 보여주었지만, 신뢰할 수 있는 패치 단위 추론은 여전히 어려운 문제입니다. 종단 병리학 MLLMs는 종종 형태학적 특징을 환각하고, 최근 agent 시스템은 일반적으로 도구 출력과 검색된 지식을 공유된 context로

산업 6월 5일

2026년 5월에 발표한 최신 인공지능 뉴스

구글은 2026년 5월에 AI 업데이트를 여러 번 발표했습니다. 1. 구글은 대규모 언어 모델(LLM)을 더욱 안정적으로 사용할 수 있도록 하는 새로운 알고리즘을 발표했습니다. 이 알고리즘은 LLM의 오류를 줄이고 더 신뢰할 수 있는 결과를 제공하는 데 도움이 됩니다. 2. 구글은 새로운 AI 모델인 '멀티모달 시각 인식 모델'을 발표했습니다. 이 모델은 여러 가지 시각적 데이터를 처리하고

연구 6월 5일

내가 알고 있는 멘트, 그 멘트가 오늘 처음 나왔을 때도: 개방형 지식 획득을 통해 진화하는 멘트 이해

멘트는 동적이며 최신의 배경 지식을 필요로 하는 경우가 많습니다. 기존의 방법들은 이러한 지식을 무시하거나固定된 파라미터 지식을 사용하여 훈련된 모델의 지식이 부족하거나 outdated하거나 unavailable하다는 문제를 해결하지 못했습니다. 저희는 Query Retrieve Conclude라는 zero-shot framework를 제안하여 미치는 지식을 식별하고 개방형 웹 증거를 검색하고 증거를 기반으로 배경 지식을 합성하여 멘트 이해와 감지에 도움이 됩니다. 또한 저희는 2024년부터 2026년까지의 최근 멘트를 포함하는 개선된 멘트 이해 벤치마크를 제안하였습니다. 세 가지 멘트 이해 데이터 세트와 다섯 가지 멘트 감지 태스크에서 실험을 통해 저희의 프레임워크는 zero-shot baseline보다 지식 회복, 멘트 이해 및 다운스트림 감지에 대한 성능을 향상시켰습니다.

LLM PC 6월 4일

비주얼-어시스트드 매트릭스 문제 해결 벤치마크

arXiv:2606.04244v1 - 새로운 발표 요약: 다중 모드 대규모 언어 모델은 복잡한 추론 능력을 보유하고 있지만, 그들은 일반적으로 도구를 통해 문제를 외부화하고 도구의 출력을 바탕으로 추론할 때 성능이 저하되는 경향이 있다. 특히, 시각적 도움을 의존할 때 그렇다. 이 괴리는 실제 엔지니어링 및 과학적 워크플로가 분석, 유효성 검사 및 의사 결정에 시각화 도구를 의존하기 때문이다

AI 모델 6월 3일

치의보건에서 대형 인공지능 모델: 일반 용도 시스템부터 도메인 특화 기본 모델까지

구강 질환은 전 세계 3.5억 명에게 영향을 미치지만 치과 분야에서 대규모 인공지능 모델의 상대적 임상 가능성은 아직 잘 이해되지 않았다. 세 가지 모델 카테고리가 나타났는데, 언어 생성 모델, 판별적 비전 기초 모델, 치과 특화 기초 모델로, 이들 간의 관계와 함께한 한계를 조사하는 통합적인 리뷰는 존재하지 않는다. PubMed, Google Scholar, Scopus, arXiv를 포함

AI 모델 6월 3일

해결책보다 생각하기: 큰 추론 모델에서 해로운 과도한 생각 평가

대규모 추론 모델(LLM)은 더 많은 테스트 시간 컴퓨팅을 통해 명시적인 중간 추론 트레이스 생성으로 성능을 향상시키나, 더 dài한 추론이 항상 유리한지 여부는 여전히 충분히 검토되지 않은 상태이다. 최근 연구 결과에 따르면 추가적인 추론이 모델이 과도하게 생각하는 것을 유도할 수 있음을 보여주지만, 우리는 다음과 같은 질문을 던진다: "모델이 올바른 답을 찾으면, 더 많은 추론이 솔루션을

에이전트 6월 3일

성장하는 환자 경로 모델을 위한 환자 호흡기 암 초기 검출을 위한 자기 진화하는 다중 agent 시스템: Traj-Evolve

전자 의료 기록(EHRs)에서 환자 경로를 모델링하는 데는 장기적이고 다중 모드의 시차가 심하고 노이즈가 많은 시퀀스를 처리하는 것이 필요하다. 기존의 대규모 언어 모델(LLM) 기반의 다중-agent 시스템은 컨텍스트 길이를 처리하지만 환자를 고립시켜 클리닉이 누적된 경험을 활용하는 것처럼 동일한 이전 사례에서 정보를 통합하는 것을 실패했다. Traj-Evolve는 두 가지 상호 보완적인

AI 모델 6월 3일

전자 의료 기록 표현을 대형 언어 모델과 일치시키기 위한 건강한 임상 판단의 기초

대규모 언어 모델(LLM)은 의료 결정 지원을 위한 강력한 자연어 논리 능력을 보이지만, 구조화된 장기 전자 의료 기록(EHR)의 효과적인 모델링에 어려움을 겪습니다. 반면, EHR 기반 모델은 예측 가능한 환자 표현을 학습할 수 있지만, 해석 가능한 언어 기반 논리를 제공하지 못합니다. 이 격차를 해결하기 위해, 우리는 구조화된 EHR 표현과 프리트레인된 LLM의 의미 공간을 연결하는 작업

LLM PC 5월 29일

다중 모드_AGENT 프레임워크: 엔드 투 엔드 자동 유한 요소 분석

유한 요소 분석(FEA)은 현대 공학 설계의 기초를 담당하지만, 워크플로우는 복잡하고 전문 지식에 의존한다. 최근 연구에서는 대규모 언어 모델(LLM)을 유한 요소 분석에 통합했지만, 기존 접근법은 다중 모드 입력을 처리하고 복잡한 작업을 수행하는 데 제한이 있다. 이러한 제한을 해결하기 위해, 우리는 VFEAgent라는 엔드 투 엔드 다중 Agent 시스템을 제안한다. 이 시스템은 입력 이미지를 포함한 다중 모드 입력과 문제 설명을 통해 유한 요소 모델링과 시뮬레이션을 자동화한다. 시스템의 주요 구성 요소는 다중 모드 비전-언어 다중 Agent PIPELINE과 확인-first 코드 합성 프레임워크이다. 시스템은 다양한 공학 역학 시나리오에서 평가되었으며, 결과는 VFEAgent가 높은 성공률로 완전하고 물리적으로 유효한 시뮬레이션을 생성하며, LLM 기반 기본 메서드보다 신뢰성과 정확성을 뛰어난 성능을 보여준다. 이러한 결과는 엔드 투 엔드 유한 요소 분석 워크플로우의 자동화를 가능하게 하며, 엔지니어들이 번거로운 수동 분석에서 해방되도록 하는 프레임워크의 잠재력을 강조한다.

에이전트 5월 27일

장기 사용자 상호작용에서 embodie된 다중 모드 언어 모델 에이전트 개인화

대규모 멀티모달 언어 모델(LLLM)- 기반 몸체(agent)가 물리 환경에서 복잡한 작업을 해결하는 데 강력한 잠재력을 보인다. 하지만 개인화된 지원은 일반적인 지시를 따르거나 물체 카테고리만 식별하는 것보다 더 필요하다. 실제 세계 시나리오에서 목표는 종종 이전 상호 작용을 통해 암시적으로만 지정되며, 시간이 지남에 따라 축적된 개인화된 맥락을 활용하여 agent가 개인화된 맥락과 시각적

AI 모델 5월 23일

언어 모델에서 거부를 피하는 잠재 공간 공격

예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어, 예를 들어,

LLM PC 5월 20일

구글이 25년 만에 처음으로 검색 상자를 리디자인했습니다 – 그 이유는 더 중요합니다.

구글이 25년 만에 처음으로 검색 상자를 리디자인했습니다 – 그 이유는 더 중요합니다. 구글의 검색 상자는 25년 동안 컴퓨팅의 가장 인식적인 인터페이스 중 하나였습니다. 얇은 흰색 사각형, 깜박이는 커서, 몇 개의 입력 문자, 그리고 파란색 링크 목록. 화요일, 구글은 그 PARA드igm을 공식적으로 은퇴했습니다. 구글의 개발자 회의(I/O developer conference)에서, 구글은 검색 상자를 리디자인했습니다 – 이 때 BILLIONS의 질의가 시작되는 실제 텍스트 필드에서 – 간단한

인기 태그