본문으로 건너뛰기

#arXiv

1186개의 기사

에이전트 6월 16일

위험 인식 기반 LLM agent를 위한 지리 공간 데이터 검색: 설계 및 초기 적대 평가

우리는 cloud-based 지리 공간 카탈로그에서 자연어 쿼리 사용하여遠距離 센싱 데이터를 검색하는 LLM 구동 프레임워크를 제시합니다. 시스템은 사용자의 의도를 구조화된 API 호출로 변환하여卫星 사진과 환경 데이터에 효율적인 접근을 허용합니다. 아키텍처는 세 가지 agent를 통합합니다: 안전성과 정책 집행을 위한 Guardrail, 의도 해석을 위한 General-QA, schema-

AI 모델 6월 16일

모델링에서 시간까지 고려하는 이벤트 모델링을 위한 크로스 모달 표현 대응

accurate 시간까지 발생하는 예측(TTE)은 멀티모달 클리닉 데이터에서 어려움을 겪고 있습니다. 이는 모달 불균형과 분포 shift로 인해 발생합니다. 우리는 CT 영상과 연속적인 EHR 데이터 사이의 모달 대응을 위한 foundation model-기반 프레임워크를 제안합니다. 이 프레임워크는 여러 작업과 기관에서 일반화가 가능합니다. CT와 EHR 모달리티는 각각 domain-spe

에이전트 6월 16일

컴퓨터 사용 에이전트의 안전성 평가를 위한 벤치마크

컴퓨터 사용을 위한 agent의 평가가 점점 더 현실적인 데스크톱과 웹 작업을 완수하는지 여부로 이루어지고 있습니다. 그러나 작업의 성공만으로는 agent가 안전하지 않은 단축 경로를 통해 목표를 달성하는 실패를 놓치게 됩니다. 우리는 OSGuard라는 안전성을 평가하는 데 사용되는 컴퓨터 사용 agent의 이중 granular benchmark suite를 소개합니다. OSGuard는 사용

AI 모델 6월 16일

메트릭 매치: LLM 심판 신뢰도 평가를 위한 서브셋 선택 접근법

LLM 판독기(LLM judges)는 오픈 엔드 텍스트 생성(open-ended text generation)을 평가하는 데 드는 비용이 많이 드는 인간 노동의 필요성을 줄이기 위해 사용됩니다. 그러나 이러한 판독기의 신뢰도는 인간 평가자와의 일치(property)가 결정하는데, 그 자체도 비용이 많이 드는 인간 주석(annotation)에 의존합니다. 이 연구에서는 제한된 주석(annota

AI 모델 6월 16일

인공 지능의 기억 추적: 생물학적 기억 단위와 인공 지능의 기억

인공 지능은 생물학적 기억과 유사한 identifiable 기억 추적을 보유하는지 여부가 여전히 열린 문제입니다. 본 연구에서는 기하학적 프레임워크를 통해 AI engram을 식별하고, 생물학적 기억의 특성인 명확성, 재활성화, 충분성, 필요성 등을 포함한 제한된 역역 문제를 formalize했습니다. 본 연구는 대규모 언어 모델(LLM) 등 다양한 실험을 통해 AI engram의 유의미성과 대규모 확장성을 입증했습니다.

연구 6월 16일

의미강화된 검색 보강 시계열 예측

시계열 예측 모델은 역사적인 패턴에서 많은 이점을 얻습니다. Retrieve-Augmented Generation(RAG)에서 영감을 받아 최근 연구에서는 시계열 예측을 향상시키기 위해 관련된 역사적인 시계열 구간을 검색하는 것을 탐구했습니다. 그러나 비stationarity 하에서만 시계열 유사성을 단지 의존하는 것은 종종 충분하지 않습니다. 이를 해결하기 위해 우리는 멀티모달 접근을 제안

에이전트 6월 16일

LLM agent에 대한 표준화된 Prolog 도구 인터페이스: PrologMCP

프론티어(_frontier) 논리 reasoning-tuned 언어 모델은 깊은 deductive 작업에서 실패하고, 내부 reasoning을 확장하여 성능을 개선하는 비용은 좋지 않다. Symbolic delegation은 논리 프로그래밍의 자동 formalization pipe line을 통해 문제를 번역하고, 해결기를 통해 추론을 수행하는 보완적인 경로를 제공한다. 그러나 현재 논리 프

에이전트 6월 16일

직접 корпус 상호 작용을 위한 동적 작업 공간 확장

대규모 언어 모델(LLM)을 위한 에이전트 검색은 스케일러블한 후보물질 발견을 위한 리트리버 매개 인터페이스(예: BM25 또는 ColBERT)를 사용합니다. 이러한 인터페이스는 관련 문서를_ranking하는 데 효과적이지만, 에이전트가 문서 간에 제약을 확인하고 재조직하는 능력을 제한하는 ranked 결과 또는 bounded 문서 뷰만 제공합니다. 문서 간 제약 확인과 재조직을 위한 Dir

AI 모델 6월 16일

LLM 출력을 설명하는 좋은 설명의 정의와 그것에 대한 난제

인공지능의 출력물에 대한 설명의 좋은 기준은 오래된 철학적 논쟁 중 하나로 최근 관심을 다시 끌고 있습니다. 설명 가능성은 많은 상황에서 인공지능의 채택에 중요하지만, 좋은 인공지능 시스템 설명을 만들기 위해서는 먼저 좋은 설명의 기준을 이해해야 합니다. 본 논문에서는 counterfactual explanations(Counter사실적 설명)의 개념을 참고하여 좋은 설명의 기준을 제시합니다

AI 모델 6월 15일

데이터 임베딩을 위한 하이퍼디멘셔널 컴퓨팅: 구조화된 쿼리와 테이블 데이터

데이터 임베딩은 데이터 프로파일링 및 통합 PIPELINE의 기본 요소로, 엔티티 인식 및 해결, 스키마 일치, 열 타입 감지, 테이블 검색 등 다양한 작업을 수행할 수 있습니다. 그러나 현재 임베딩 방법론의 주요한 단점은 비해지지 않는 유사도 점수라는 것입니다. 이 유사도 점수는 유의미한 의미를 지니지 않으며, 이웃이 진짜 매칭인지 아니면 단순히 비슷한 항목 중에서 가장 적은 거리를 갖는 항목인지 구별할 수 없습니다. 이러한 비해지지 않는 유사도 점수는 실제 매칭이 없는 경우에 특히 문제가 됩니다. 이 연구에서는 하이퍼디멘셔널 컴퓨팅(HDC) 프레임워크를 사용하여 테이블 행 임베딩을 수행할 수 있는지에 대한 연구를 수행합니다. HDC를 사용하여 구조화된 SELECT-PROJECT 쿼리를 벡터 공간에서 수행할 수 있습니다. HDC의 대수적 속성을 사용하여, 우리는 일치 및 비일치 검색谓词의Closed-form 기대 유사도 값을 계산할 수 있습니다. 이러한 유사도 값은 차원 수가 증가함에 따라 해석할 수 있는 값으로 수렴합니다. 이러한 유사도 값을 사용하여, 우리는 적절한 검색 임계값을 식별할 수 있습니다.

AI 모델 6월 15일

포커 아레나: 전략적 사고와 LLM의 기억능력 다중 축 프로파일링

불확실성을 감안한 전략적 사고는 협상, 금융, 정책 등에서 중요한 결과를 내는 결정에 기반을 두고 있지만 현재 게임 벤치마크는 다양한 사고 차원들을 단일 스칼라로 축소시키고 있다. 이로 인해 최첨단 대규모 언어 모델(LLM)의 기능 구조가 조사되지 않았다. 우리는 포커 아레나(Poker Arena)라는 무제한 텍사스 홀덤 토너먼트 플랫폼을 소개한다. 이 플랫폼은 세 가지 메모리 아키텍처(한

AI 모델 6월 15일

LLM을 이용한 수학적 분석의 정리 증명에 대한 두 단계 평가 시스템: MA-ProofBench

대규모 언어 모델(LLMs)은 자동 증명 논리를 크게 진전시키면서도 현재까지 존재하는 공식 평가 지표는 수학적 범위와 난이도에서 모두 제한적이다. 대부분은 대수학과 초등 수학적 수학 이론과 같은 더 쉽게 공식화되는 분야에 집중되어 있으며, 더 깊은 사고를 요구하는 하위 분야인 수학적 분석에 대한 범위는 제한적이다. 이러한 공백을 해결하기 위해 우리는 Mathematical Analysis를

연구 6월 15일

인공지능 사용의 수용성인가 사용 확대인가? : 낮은 문해력/더욱 높은 사용률 간 도구별 재분석

최근으로 Tully, Longoni, 및 Appel (2025)가 제시한 증거에 따르면, 인공 지능(AI) Literacy가 낮은 사람들은 AI에 대한 더 큰 수용성을 보인다고 보고했다. 우리는 이 주장을 재확인하기 위해 그들의 연구의 세 번째 연구에서 공개된 데이터를 사용했다. 그 데이터는 5가지 AI 도구 카테고리의 과거 사용 빈도 scale을 측정했다. 먼저, 우리는 참여자별 평균에 O

AI 모델 6월 15일

샘플 선택 편향이 모델 붕괴를 일으키는 경우

자연어 처리 연구에서 재귀적 학습이 합성 데이터에 적용될 때, 데이터 부족 문제를 해결할 수 있지만 모델 붕괴를 일으킬 수 있다. 모델 붕괴는 학습이 반복되면서 분포의 꼬리 부분이 소실되고 출력값이 동일해지는 현상이다. 데이터 선택을 통해 붕괴를 방지하는 방법으로 간주하지만, verifier가 사용하는 참조 분포에 따라 선택의 신뢰도는 결정된다. 우리 연구에서는 저자원이 있는 검증 환경에서

에이전트 6월 15일

다중 BI: 비즈니스 지능성 داش보드와 효율적인 증강된 상호작용을 위한 자율적인 디지털 트윈

사업 지능(BI)은 최근 대규모 언어 모델(LLM) 기반 지원과 대시보드 상호 작용을 결합하고 있지만, 다단계 분석 시 두 가지 모드가 동기화되지 않아 어려움을 겪고 있다. 사용자가 직접 대시보드 조작과 자연어 질의 사이에서-switch 할 때, 필터, 계층, 지표, 차트 콘텍스트와 같은 분석적 상태를 일관성 있게 유지하는 것이 어려워진다. 우리는 두 가지 모드를 동시에 사용하는 동안 일관성

AI 모델 6월 15일

단일 방향 저항을 뛰어넘다: Diff-in-Means와 INLP의 초기 비교

안정화된 대화 모델에서 거부의 한 가지 선형 방향에 의해 매개되는지 여부를 확인하고, 이에 대한 대안으로 Iterative Nullspace Projection(INLP)을 제안하는 연구입니다. 연구 결과, INLP는 DiM과 비슷한 결과를 показ했으며, 더 많은 파라미터를 가진 richer parameterisation이 더 유연한 intervention을 제공한다는 것을 보여주었습니다.

에이전트 6월 15일

작업환경의 재조명: 2년이 지난 작업환경 대리인

arXiv:2606.13715v1 발표 종류: 새로운 논문 요약 2024년 3월 WorkBench에서 가장 뛰어난 agent는 GPT-4였으며, 그 중 43%를 완료하고 26%에서 의도하지 않은 해로운 행동을 취했습니다(예를 들어, 잘못된 사람에게 이메일을 보냈습니다). 2026년 6월에 이 벤치마크를 다시 방문했을 때, 현재까지 가장 뛰어난 agent인 Claude Opus 4.8은 89%

에이전트 6월 15일

합성 개방형 삼중 진화는 더 나은 깊은 연구자를 만든다.

인공지능이 실제 세계에서 일반 인공지능을 달성하기 위해 수행하는 facto 작업으로는 심층 연구와 agent의 진화가 있습니다. 심층 연구는 개방된 환경에서 개방된 연구 작업을 해결하기 위해 정보의 자율적 수집과 통합을 허용하는 반면, agent 시스템의 정적 매개변수 심층 연구 능력에 의해 제한됩니다. 다른 한편으로, agent는 환경과 자율적으로 상호 작용하여 경험을 얻어 모델 능력을 진

인기 태그