본문으로 건너뛰기

#AI 에이전트

961개의 기사

에이전트 6월 17일

행동 기반 암시적 결정 요인에 기반한 만족도 인식하는 맵 에이전트의 성능 평가: MapSatisfyBench

대규모 언어 모델 에이전트가 점차적으로 지도 서비스에 통합되고 있습니다. 지도 서비스는 일상 생활 시나리오에 비해 전문적인 업무 환경에 통합되지 않기 때문에 사용자는 종종 사용자의 필요를 구체적으로 표현하지 못하고, 명시적으로 표현하지 못한 여러 가지 필요, 즉 암묵적 결정 요소들을 포함하는 미분명한 질의를 내놓습니다. 이러한 문제를 해결하는 가장 효과적인 방법은 사용자와의 대화에서 명확성을

에이전트 6월 17일

분산 일반 목적 agent 네트워크: 아키텍처, 주요 메커니즘 및 프로토타입

대규모 언어 모델(LLM)은 대화 협력자에서 자율적이면서 목표를 이해하고 행동을 계획하고 도구를 호출하고 다단계 작업을 수행하는 자율적 인 agent로의 전환을 촉진했습니다. 그러나 단일 agent의 능력은 지역 데이터, 도구 허가, 실행 환경 및 통치 경계에 의해 제한됩니다. 이 논문은 분산 일반-purpose agent 네트워크를 연구합니다: 개방형 peer-to-peer 네트워크에서 개

AI 모델 6월 17일

장기 기억의 최종 정확도에서 놓친 부분을 탐색하는 MemTrace

대규모 언어 모델(LLM) 에이전트는 점차적으로 사용자의 정보를 여러 세션 동안 유지하는 장기 기억력을 유지하고 있습니다. 그러나 일반적으로 이러한 기억력은 질문 행이나 에피소드의 정확도 합계로 평가됩니다. 그러나 이 방법은 여러 질문이 동일한 사실을 조사하는 경우에도 각 질문 행을独立으로 평가하므로, 그 사실이 조건이 달라짐에 따라 어떻게 행동하는지 보여주지 못합니다. 우리는 MemTrac

에이전트 6월 17일

규칙이 학습할 때: 법적 사례 검색을 위한 자율 진화 요소

법률 문서 검색은 법률 용어의 복잡성과 쿼리와 관련된 문서 간의 정확한 단어 대응이 필요한데다 어려움을 겪고 있습니다. although dense retrieval models는 눈에 띄는 진전을 이루었지만, 실증 연구 결과 BM25는 여전히 이 영역에서 강력한 기준선으로 기능하고 있습니다. 그러므로 BM25를 parameter training없이 향상시키는 rule-driven query

에이전트 6월 17일

대응형 탐색을 위한 다원적 쿼리 초기화: 파라다임이 병렬되는 샘플링의 초월

인공지능이 목표를 달성하기 위해 필요한 과정을 수시로 반복하는 '대화식 탐색'에서, 목표 달성을 위한 과정을 더 많이 반복하거나 더 많은 과정을 동시에 진행하는 두 가지 방법 중 하나를 선택하여 과정을 더 빠르게 진행하는 '시간당 확대'를 연구했다. 이번 연구에서는 '동시 탐색' 방법에 집중하였으며, 일반적인 동시 샘플링 방법은 성능이 점차적으로 저하되는 것을 발견하였다. 이는 첫 번째 질문

LLM PC 6월 16일

가정 가능한 자율 데이터 과학을 위한 증명 가능한 데이터 과학: 툴-기반 논리 reasoning을 통해 불규칙 TSQA 해결

실세계 배포에서는 시간 시리즈 데이터가 극도로 불규칙합니다. 관측치는 비동기적이며, 누락된 값은 무작위가 아닌 정보가 풍부한 값이며, 센서 및 작동 창구별로 샘플링 빈도는 다릅니다. 그러나 기존의 시간 시리즈 질의 응답(TSQA) 벤치마크는 대개 정칙적으로 샘플링된 입력을 가정합니다. 이는 대규모 언어 모델(LLMs)과 인공지능 agent가 불규칙한 조건 하에서 성능을 어떻게 발휘하는지에 대

에이전트 6월 16일

위험 인식 기반 LLM agent를 위한 지리 공간 데이터 검색: 설계 및 초기 적대 평가

우리는 cloud-based 지리 공간 카탈로그에서 자연어 쿼리 사용하여遠距離 센싱 데이터를 검색하는 LLM 구동 프레임워크를 제시합니다. 시스템은 사용자의 의도를 구조화된 API 호출로 변환하여卫星 사진과 환경 데이터에 효율적인 접근을 허용합니다. 아키텍처는 세 가지 agent를 통합합니다: 안전성과 정책 집행을 위한 Guardrail, 의도 해석을 위한 General-QA, schema-

에이전트 6월 16일

컴퓨터 사용 에이전트의 안전성 평가를 위한 벤치마크

컴퓨터 사용을 위한 agent의 평가가 점점 더 현실적인 데스크톱과 웹 작업을 완수하는지 여부로 이루어지고 있습니다. 그러나 작업의 성공만으로는 agent가 안전하지 않은 단축 경로를 통해 목표를 달성하는 실패를 놓치게 됩니다. 우리는 OSGuard라는 안전성을 평가하는 데 사용되는 컴퓨터 사용 agent의 이중 granular benchmark suite를 소개합니다. OSGuard는 사용

에이전트 6월 16일

LLM agent에 대한 표준화된 Prolog 도구 인터페이스: PrologMCP

프론티어(_frontier) 논리 reasoning-tuned 언어 모델은 깊은 deductive 작업에서 실패하고, 내부 reasoning을 확장하여 성능을 개선하는 비용은 좋지 않다. Symbolic delegation은 논리 프로그래밍의 자동 formalization pipe line을 통해 문제를 번역하고, 해결기를 통해 추론을 수행하는 보완적인 경로를 제공한다. 그러나 현재 논리 프

에이전트 6월 16일

직접 корпус 상호 작용을 위한 동적 작업 공간 확장

대규모 언어 모델(LLM)을 위한 에이전트 검색은 스케일러블한 후보물질 발견을 위한 리트리버 매개 인터페이스(예: BM25 또는 ColBERT)를 사용합니다. 이러한 인터페이스는 관련 문서를_ranking하는 데 효과적이지만, 에이전트가 문서 간에 제약을 확인하고 재조직하는 능력을 제한하는 ranked 결과 또는 bounded 문서 뷰만 제공합니다. 문서 간 제약 확인과 재조직을 위한 Dir

에이전트 6월 15일

다중 BI: 비즈니스 지능성 داش보드와 효율적인 증강된 상호작용을 위한 자율적인 디지털 트윈

사업 지능(BI)은 최근 대규모 언어 모델(LLM) 기반 지원과 대시보드 상호 작용을 결합하고 있지만, 다단계 분석 시 두 가지 모드가 동기화되지 않아 어려움을 겪고 있다. 사용자가 직접 대시보드 조작과 자연어 질의 사이에서-switch 할 때, 필터, 계층, 지표, 차트 콘텍스트와 같은 분석적 상태를 일관성 있게 유지하는 것이 어려워진다. 우리는 두 가지 모드를 동시에 사용하는 동안 일관성

에이전트 6월 15일

작업환경의 재조명: 2년이 지난 작업환경 대리인

arXiv:2606.13715v1 발표 종류: 새로운 논문 요약 2024년 3월 WorkBench에서 가장 뛰어난 agent는 GPT-4였으며, 그 중 43%를 완료하고 26%에서 의도하지 않은 해로운 행동을 취했습니다(예를 들어, 잘못된 사람에게 이메일을 보냈습니다). 2026년 6월에 이 벤치마크를 다시 방문했을 때, 현재까지 가장 뛰어난 agent인 Claude Opus 4.8은 89%

에이전트 6월 15일

합성 개방형 삼중 진화는 더 나은 깊은 연구자를 만든다.

인공지능이 실제 세계에서 일반 인공지능을 달성하기 위해 수행하는 facto 작업으로는 심층 연구와 agent의 진화가 있습니다. 심층 연구는 개방된 환경에서 개방된 연구 작업을 해결하기 위해 정보의 자율적 수집과 통합을 허용하는 반면, agent 시스템의 정적 매개변수 심층 연구 능력에 의해 제한됩니다. 다른 한편으로, agent는 환경과 자율적으로 상호 작용하여 경험을 얻어 모델 능력을 진

인기 태그