본문으로 건너뛰기

#arXiv

1177개의 기사

에이전트 7월 22일

대규모 언어 모델이 계획하는 실행 그래프: 대규모 엔터프라이즈 데이터에 대한 확장 가능한 임의 분석을 위한 BatchDAG

대규모 언어 모델(LLM)은 개별 문서 분석에서 뛰어나지만 엔터프라이즈 규모의 데이터 세트에 대한 exhaustive, cross-entity 분석 질문에서 맥락 초과, 각 엔티티의 속성 잃기 및 선형 지연으로 붕괴됩니다. BatchDAG 시스템은 LLM이 SQL 쿼리, 의미 검색, 인메모리 변형, 병렬 팬 아웃 및 단일 샷 분석의 typed directed acyclic graph(DAG) 생성을 통해 엔터프라이즈 데이터에 대한 확장 가능한 임의 분석을 제공합니다.

에이전트 7월 22일

증거 Chain 평가를 통해 선택적 사실 확인을 위한 조정

대규모 언어 모델(LLM)은 사실 확인 정확성을 높일 수 있지만 강제적인 이진 결정을 통해 중요한 신뢰성 문제가 숨겨져 있다. 즉, 시스템은 강한 판결을 내리며도 증거가 약하거나 희박하거나 내부적으로 일관성이 없는 경우가 있다. 우리는 이 문제를 해결하기 위해 증거 Chain Evaluation(ECE)이라고 하는 선택적 사실 확인 프레임워크를 통해 abstention을 허용함으로써 강제적인

AI 모델 7월 22일

시스템 관리자: 전위 AI에서 권력 추구 행위 측정

AI 시스템이 과제 요구 사항을 넘어 리소스를 획득하거나 감독을 피하거나 중지에 저항하는 행동을 구현하는 것을 '권력 추구'라고 정의하고 있습니다. 이 연구에서는 SysAdmin이라는 벤치마크를 제시하여 프런티어 언어 모델을 고도로 신뢰할 수 있는 리눅스 샌드박스 내에서 자율 시스템 관리자로 위치시켜서 5가지 차원(자신을 보호하기, 자율성을 증가시키기, 리소스를 획득하기, 환경을 수정하기,

연구 7월 21일

강화 학습 정책 검증에 대한 조사

인공지능을 기반으로 하는 정책의 엄격한 행동 보증이 부족하여 강화 학습(RL)은 점점 더 복잡하고 안전한 영역에서 적용되고 있다. 정책 표현력과 규모의 최근 발전은 이 문제를 더욱 심화시켰고, 강화 학습 정책 검증에 대한 개념적으로 분산된 연구를 급속히 증가시켰다. 이 서베이는 강화 학습 검증 방법에 대한 통일된 관점을 제공한다. 우리는 세 가지 축인 검증 패러다임(형식적 versus 확률적

AI 모델 7월 21일

컨텍스트 리랭킹과 삭감을 위한 협력 게임 관점의 셰플리 컨텍스트 삭감

modern Retrieval-Augmented Generation(RAG) 시스템의 효율성을 향상시키기 위해 Context reranking과 pruning은 필수적이 되면서도 해석 가능한 통합 프레임워크는 여전히 탐구되지 않은 상태이다. 이전 연구는 주로 어휘 검색, 크로스 인코더 아키텍처, 모델 학습 distillation, Low-Rank Adaptation(LoRA) 등에 중점을 두

연구 7월 21일

다중모달 그래프 RAG를 위한 후기 상호작용 증거 검색: ColGraphRAG

대규모 언어 모델(LLM)에서 그래프와 관련된 멀티모달 질의응답 시스템을 개선하기 위해, 우리는 그래프에 연결된 이미지 노드에 대한 시각적 후보 랭킹 연산자를 ColBERT/ColPali 계열의 Late-Interaction MaxSim-style 다중 벡터 스코링으로 교체했습니다. 이 변경은 멀티모달 QA에서 그래프에 연결된 이미지 후보에 대한 검색 단계 점추정치가 향상되고, 시각적 증거가

AI 모델 7월 21일

강화 학습에서 약한 정책으로 강한 정책으로: 보조 branch를 통해 보강

강화 학습은 대규모 언어 모델(LLM)의 추론력을 향상시키기 위해 보증된 보상을 사용하는 표준적인 접근 방식으로 발전했습니다. 그러나 우리는 이 패러다임의 중요한 한계점을 발견했습니다. 즉, challenging 추론 과제에서 목표 모델의 샘플들은 종종 의미적 중복성을 보이며, 오류의 '추론 계곡'에 수렴하여 정책 업데이트에 대한 보상을 제공하지 않습니다. 이 한계점을 극복하기 위해, 우리는 약한 정책을 강한 정책으로 학습하는 패러다임을 제안합니다. 보조 모델이 목표 모델의 샘플을 보조 branch를 통해 보강하는 것을 통해, 우리는 약한 정책을 강한 정책으로 학습하는 새로운 방법을 제안합니다.

에이전트 7월 21일

마스크드 확산 언어 모델은 강력하고 조정 가능한 텍스트 기반 월드 모델 : 에이전트 RL을 위한 강력한 툴

최근 강화 학습의 성장으로 다양한 환경을 위한 대체 훈련 환경이 필요해졌습니다. 환경을 고정한 태스크와 보상 난이도가 환경 성능이 향상되면 효과적인 신호가 되지 않으며, 장기적인 보상이 희박하면 특정 워크플로우나 도구 구조에 대한 모드 붕괴를 유발합니다. 월드 모델이 환경 상태를 시뮬레이션하는 것은 순수 롤아웃 성능과 동등하게 성능을 보이므로, 다양성 요구 사항을 충족하기 위한 대용량 환경을 구축하는 데 hứ중에 있습니다. 그러나 자동 회귀 (AR) 월드 모델은 전방향 편향으로 인해 전역적으로 상호 의존적인 상태 anchor들, 즉 도구 스키마, 이전 턴, 예상 결과에 대한 조건을 설정하는 것을 방지합니다.

AI 모델 7월 21일

작은 언어 모델을 사용한 인공지능 민주화: 지역 배포를 위한 구조화된 벤치마킹 및 매개 변수 효율적인 tinh회정

인공지능 민주주의는 주로 대규모 언어 모델의 일반성을 맞추는 문제가 아니고, 대규모 언어 모델(LLM)가 하드웨어와 관리 제약으로 인해 일반 기관이 만족할 수 있는 범위 내에서 선택, 감사, 분산되도록 할 수 있는 문제입니다. 본 논문은 135M에서 3B 파라미터까지의 9개의 오픈-웨이트 언어 모델이 1,085 개의 예시와 16 개의 주제를 가진 다중 선택 시험지에 대한 구조화된 지역 배포를

AI 모델 7월 21일

세대형 개념구조誘導: 도메인에 구애받지 않는 문서 집합에서 대규모 언어 모델을 사용한 스키마 발견

지식 집중형 인공지능 시스템에서 Ontology engineering은 여전히 중요한 걸림돌이다. 현재의 자동화된 접근법은 대부분 사전 정의된 스키마에 의존하거나 좁은 도메인에서 작동하거나, 다운스트림 pipe line에 적합하지 않은 구조화되지 않은 출력을 생성한다. 우리는 Generative Ontology Induction (GOI), 도메인에 독립적인 프레임워크를 소개한다. GOI는

에이전트 7월 21일

인공지능_AGENT 시스템의 결정론적 재생

AI agent 시스템이 대규모 언어 모델(LLMs)와 외부 도구 및 API를 결합하는 것은 본질적으로 결정론적이지 않다: LLM 샘플링 분산, 외부 API 상태, CDN 인프라 헤더, 실행 환경 잡음이 collectively prior agent 실행을忠實하게 재실행하는 것을 막는다. 기존 관찰 가능성 플랫폼은 실행 로그를 캡처하지만 단독으로 실행을 재현할 수 없다. 우리는 개발자 중심의

에이전트 7월 21일

플랜 플립: 멀티 에이전트 LLM 시스템 공격하기

멀티 에이전트 LLM 시스템이 계획 단계를 통해 목표를 분해하고, 이하의 이행자와 심사자 에이전트가 실행하고 감사하는 데 의존하는 것을 발견했습니다. 계획 단계는 공격 표면으로 인식되었으며, 계획자에 대한 단일 입력을 통해 동시적으로 모든 하위 작업이 부패되었습니다. 우리는 플랜 플립을 제시했습니다. 플랜 플립은 4 가지 계획 단계 지시어 삽입 공격을 포함합니다. - 목표 대체 (PF-1), 우선순위 반전 (PF-2), 맥락 오염 (PF-3), 역할 혼란 (PF-4) - 각은 의도적으로 키워드 필터를 회피하기 위해 합리적인 도구 출력으로 위장되었습니다. 우리는 9 개의 선도적인 LLM을 3,479 회의 에피소드에 걸쳐 평가했습니다. 우리는 세 가지 발견을 확인했습니다: (1) 능력은 취약성을 증폭시킵니다 - GPT-5는 가장 높은 공격 성공률 (ASR = 0.68)을 달성했습니다. 이는 더 강력한 모델이 자체적으로 더 안전하다는 가정에 반하는 것입니다; (2) 유사한 pipeline은 연관된 에이전트의 무시를 보여줍니다 - GPT-4o와 Llama-3.3-70B는 ASR가 근소한 차이로 0에 근접하지만 Stealth = 1.00과 StepShift > 0을 보였습니다. 공격은 계획을 재구성했지만 동일한 백본 Critic은 동의를 보고했습니다 (2 개의 independent judge가 -0.20에서 -0.32의 의미적 편차를 확인했습니다, r = 0.943); (3) 논리 증강 모델은 삽입 공격에 저항합니다 - DeepSeek-R1는 모든 공격에 대해 StepShift = 0.00을 달성했습니다. 우리는 GoalAnchorCheck (D1)과 CrossAgentConsensus (D2)를 제안했습니다. 이 두 가지 검출 기법은 1.00까지의 검출률을 달성하고, 16 개의 셀 중 15 개에서 동일한 백본 baseline보다 우수했습니다.我们的 핵심 발견: 다양한 모델 다양성은 멀티 에이전트 시스템의 보안 요구 사항입니다. 유사한 백본 내의 중복성은 계획 단계 공격에 대한 보호를 제공하지 않습니다.

연구 7월 21일

GNN 기반 링크 예측 기술, 응용 및 장애물: 최신 동향과 미래 방향

링크 예측에 있어 Graph Neural Networks (GNNs)가 최근 주목받고 있다. 그러나 기존 리뷰는 GNN 아키텍처와 다양한 그래프 구조에 대한 체계적인 탐색을 제공하지 못했다. 이 연구에서는 GNN 기반 링크 예측의 체계적인 리뷰를 제공하고, 새로운 GNN 관점에서 최근 기술과 응용을 분류한다. GNN 기반 링크 예측의 기술과 응용을 살펴보고, 현재의 장애물과 미래의 방향을 논의한다.

AI 모델 7월 21일

위험 태도와 AI: 대규모 언어 모델의 안정적인 위험 태도

연구진은 대규모 언어 모델의 위험 태도를 테스트하고, 그 결과를 통해 AI 시스템의 행동을 평가하고 조정하는 데 중요한 시사점을 찾았습니다. 연구 결과, 대규모 언어 모델은 안정적인 위험 태도를 나타내고, 이는 인간의 위험 태도와 비교할 때 한정된 범위 내에서 위험 태도가 수렴하는 것을 의미합니다.

AI 모델 7월 21일

가볍고 1차원 CNN을 사용한 감정적인触각 분류를 위한 소프트 플러시 동반자의 설계 및 검증

연구팀은 사회적 지원 기술의 물리적으로 안전하고 감정적으로 친숙한 인터페이스를 제공하는 소프트 센서화된 동료를 개발하기 위해 Soft, sensorized companions라는 개념을 제안했습니다. 그러나 이들의 변형성과 다중 채널 감각은 인간의 감정에 대한 강력한 해석을 어렵게 만들었습니다. 이 연구는 감정적 접촉 인식에 대한 소프트 인터랙티브 동료를 위한 완전한 오픈 소스 MATLAB

에이전트 7월 20일

ToolVerse: 대인격 강화 학습을 위한 거대한 환경 및 장기적인 목표를 풀어내다.

대규모 언어 모델(LLM) agent는 compact하고 잘 정의된 시나리오에서 강력한 추론 능력을示산하지만, 대규모, 다양한, 그리고 동적 세계 환경에서 TOOL INTEGRATION이 필요할 때에는 강도와 효율성이 유지되지 않는다. 이 격차를 해결하기 위해 우리는 TOOLVERSE라는 통합 framework를 도입한다. TOOLVERSE는 대규모 TOOL-INTEGRATED REASONI

AI 모델 7월 20일

LEED 준수를 위한 신경symbolic 인공지능: 문서 중심 벤치마킹, 결정론적 숫자 검증, 그리고 멀티모달이 왜 해를 끼치는지

LEED v4.1 BD+C 인증은 아직도 문서 집약적인 프로세스로, 검토자들은 수백 페이지의 프로젝트 증거를 읽고 수동으로 크레딧-특정閾치 논리를 적용해야 한다. 이 연구에서는 작고 지역적으로 구축된 언어 모델들이 LEED 문서의 의미 있는 필터링을 수행할 수 있는지, 그리고 결정론적 Symbolic 구성 요소들이 그 작업을 공유하는 방식이 무엇인지 조사한다. 프로젝트 PDF를 LEED 크레

AI 모델 7월 20일

MLLM-유도 diffusian 변환기와 관계 적응 혼합 전문가 모델을 이용한 다모드 지식 그래프 완성

Multimodal 지식 그래프 완성(Multimodal Knowledge Graph Completion, MKGC)은 구조적, 텍스트, 시각적 단서에서 누락된 엔터티를 추론하는 것을 필요로 한다. 기존의 확산 기반 MKGC 방법은 일반적으로 raw multimodal 특징에 직접 노이즈 제거를 한다. 이러한 디자인은 관계에 의존하는 단서 선택, 교차 모드 의미 부합, 구조적 엔터티 생성을

에이전트 7월 20일

<b>GUI 에이전트의 안전을 위한 SeerGuard: 세계 모델 예측을 통한 GUI 에이전트의 안전 프레임워크</b>

모바일 그래픽 사용자 인터페이스 (GUI) 에이전트는 복잡한 작업을 자동화하는 놀라운 능력을 보여주었지만, 단일 오류로 인한 irreversible 결과를 유발하는 중요한 안전 위험을 야기한다. 기존의 안전 메커니즘은 주로 반응적이고, 실행 전 위험을 평가하는 능력을 갖지 못한다. 본 논문에서는 SeerGuard라는 결과에 대한 안전 프레임워크를 제시하며, 실행 전 지시 단계별 검사와 동작 단계별 위험 평가를 통해 이러한 위험을 완화하고자 한다.

연구 7월 20일

논리, 최적화, 인공 지능: 새로운 시대에 만나다

논리와 최적화의 결합은 규칙 기반 인공지능에 귀중한 기여를 할 수 있다. 논리는 규칙 기반을 인코딩하고 추론을 수행하는 데 적합한 매체이며, 최적화는 추론을 계산하는 강력한 기술을 제공한다. 논리와 최적화의 결합은 인공지능의 투명성에 대한 증가하는 관심사로 인해 새로운 중요성을 얻고 있다. 투명성은 재현성, 설명 가능성, 신뢰성, 공정성에 중요하다. 규칙 기반 인공지능은 투명성에 대한 자연스러운 해결책을 제공하고, 오늘날 고도로 발전된 최적화 방법으로 인해 점점 더 실용적으로 보이기 시작했다.

연구 7월 20일

신뢰할 수 있는 인공지능 도구, 마크 프레임워크 및 구현 격차에 대한 비판적 분석

인공지능 시스템이 사회에 더 큰 영향을 미치는 가운데, 그들의 윤리적이고 신뢰할 수 있는 배포를 보장하는 것은 전 세계적인 우선순위가 되었다. 그러나 이러한 프레임워크는 구현 가능한具体한 기구가 부족하여 비판을 받고 있다. 이 연구는 신뢰할 수 있는 인공지능(TAI)의 구현을 위한 도구 및 신뢰 마크 프레임워크에 대한 비판적 분석을 수행하고, OECD의 광범위한 데이터 세트를 기반으로 한다. 이 연구는 대규모 언어 모델(LLM)과 같은 신뢰할 수 있는 인공지능 도구 및 프레임워크의 현재 상태를 조명하고, 구현 격차를 bridging하는 데 필요한 동향을 제시한다.

인기 태그