본문으로 건너뛰기

#RAG

46개의 기사

에이전트 7월 1일

반복적인 프롬프트 최적화에 대한 대조성 반사

정보 검색에서 대규모 언어 모델(LLM)은 정보 검색을 위한 질의를发出하고 답변을 합성하며, 점점 더 정보 검색 평가에 대한 판단자로 역할을 한다. 이러한 agent를 제어하는 질의를 개선하는 것은 최적화 문제이지만, 실용적인 정보 검색 환경에서는 더 많이 debugging으로 보인다. 엔지니어들은 어떤 행동이 실패했는지, 근처의 행동이 여전히 작동했는지, 두 행동을 구분하는 것이 무엇인지,

에이전트 6월 26일

도구 확장된 LLM agent가 실제 세계 에너지 분석 작업에서 어떻게 수행하는가?

제조 및 특정 영역(금융, 프로그래밍, 법, 의약품 개발 등)에 대한 자율성을 보장하는 기준이 일반 용도 및 특정 영역에서 등장하고 있으나, 에너지 분야에서는 주로 정적 지식의 회수에만 한정되어 있는 것으로 나타났다. 에너지 분야는 실시간 데이터 수집, 특정 규제 및 시장 지식, 그리고 실제 환경 제약하에서 다단계 양적 추론이 필요하므로, 이러한 격차는 중요하다. 우리는 실제 에너지 시장 분

에이전트 6월 25일

대인 설득에서 조합 오류를 진단하고 완화하는 분류 체계 접근법을 활용한 전략 검색

대규모 언어 모델(LLM) 에서 멀티 스텝, 오픈 엔드된 환경에서 발생하는 누적 오류는 초기의 잘못된 판단이 장기적인 트레이JECTORY를 오염시킨다. Multi-Agent Debate (MAD) 는 결정론적 도메인에서 성공을 거두지만 주관적인 과제인 설득과 같은 과제에서는 심각한 문제 드리프트와 수사적인 공복을 경험한다. 우리는 표준 Retrieval-Augmented Generation

에이전트 6월 19일

클리니컬 정보 추출을 위한 대가적 RAG: 성공과 실패 그리고 그 이유

AI 시스템이 환자 정보를 추출할 때 발생하는 데이터 불충분 문제를 해결하기 위해 개발된 대가적 클리니컬 정보 추출(Agentic Clinical Information Extraction) 기술을 소개합니다. 이 기술은 임상 의사들이 추출한 정보를 확인할 수 있도록 하는데, 이는 임상 의사들이 추출한 정보의 신뢰성을 높일 수 있도록 합니다.

연구 6월 16일

CONCORD: 기기-클라우드 RAG에서 문서 격리 하에 비동기식 희소 집계

Retrieval-augmented generation(RAG)은 추론 시 외부 지식 통합을 통해 언어 모델을 향상시키는 데 중요한 기술로 등장했습니다. 장치-클라우드 협력 추론으로 인해 작은 언어 모델을 에지 장치에 배포하는 것은 가능해졌습니다. 따라서 장치 내의 개인 문서와 클라우드 내의 공공 지식이 분리된 새로운 설정이 발생했습니다. 개인 정보 보호와 정책 제약으로 인해 raw 문서 교

연구 6월 16일

의미강화된 검색 보강 시계열 예측

시계열 예측 모델은 역사적인 패턴에서 많은 이점을 얻습니다. Retrieve-Augmented Generation(RAG)에서 영감을 받아 최근 연구에서는 시계열 예측을 향상시키기 위해 관련된 역사적인 시계열 구간을 검색하는 것을 탐구했습니다. 그러나 비stationarity 하에서만 시계열 유사성을 단지 의존하는 것은 종종 충분하지 않습니다. 이를 해결하기 위해 우리는 멀티모달 접근을 제안

에이전트 6월 12일

인간 스타일의 검색-보강 VLA agent를 이용한 폐쇄형 주행 시뮬레이션

closed-loop 주행 시뮬레이터는 일반적으로 규칙 기반의 교통 관리자나 단일 행동 모드에 학습된 모델로 생성된 비 이고 트래픽 에이전트를 환경에 채우고 있습니다. 최근 연구는 관찰 데이터에 대한 후속 라벨이나 대규모 언어 모델(LLM)로 추정한 보상 가중치를 통해 스타일 변이를 소개했습니다. 그러나 이러한 신호는 스타일이 보상해야 하는 프록시로 작용하는 반면, 사람에게 스타일에 따라 주

AI 모델 6월 4일

스텝별 프로세스-보상 가이드된 LLM 미세 조정 기법을 활용한 향상된 RTL 합성

RTL 코드 생성을 위한 디지털 하드웨어 디자인의 자동 생성은 Verilog과 VHDL에서 긴 시각적 사고, 다단계 의존성 및 엄격한 정확성 제약으로 인해 여전히 어려운 문제이다. 우리는 StepPRM-RTL 이라는 새로운 프레임워크를 제시한다. 이 프레임워크는 stepwise trajectory modeling, process-reward modeling (PRM), 및 retrieval-

에이전트 6월 4일

기업 AI_AGENT의 사전 배치 보증을 향해: Ontology 기반 시뮬레이션 및 신뢰 인증

기업용 인공지능(AI) agent의 전개 전 검증은 대규모 언어 모델(LLM) 능력 평가와 운영 배포 사이에 존재하는 중요한 빈틈입니다. 운영 배포 이후 모니터링, 인간의 participation을 포함한 제어, 프롬프트 단위의 경계는 한 agent가 운영 배포에 참여할 경우에 제한된 보장을 제공합니다. 우리는 ontology-grounded verification framework를 제안합

AI 모델 6월 2일

타입된 지식 그래프에서 하향식 유추 이해 및 쓰기 시간 지능

Grokers는 지속적인, 구조화된 타입이 지정된 지식 그래프의 이해를 위해 의존성 서브 그래프의 하위 레벨 수식적 탐색을 통해 설계된 아키텍처입니다. 정보의 이해 비용이 모든 쿼리에서 지불되는 retrieval-augmented generation (RAG)과 달리, Grokers는 지능을 쿼리 시간에 밀어 넣습니다: 자율적인 Groker agent는 타입이 지정된 스트림 그래프의 노드를

에이전트 5월 27일

인공지능이 주체적 인공지능으로 변환하기 위한 실험

이 논문은 과학 워크플로우를 위한 자율적이고 주체적인 인공지능(AI)을 개발하기 위한 두 가지 새로운 프레임워크를 상세히 설명합니다. 두 시스템 모두 구글 콜라브(Google Colab)를 통해 Hybrid Local Body, Remote Brain 아키텍처를 사용하여, 파이썬 기반의 지역 오케스트레이터를 사용하여 대규모 언어 모델(LLM) 클라우드 백엔드에 호출합니다. 첫 번째 agent

AI 모델 5월 13일

LLM 허구감지 평가에 대한 새로운 관점: 필요성, 새로운 RAG 기반 벤치마크, 새로운洞察

LLM 허구 감지 평가에 대한 새로운 관점: 필요성, 새로운 RAG 기반 벤치마크, 새로운洞察 LLM 허구, 즉 신뢰할 수 없는, 가짜, 또는 일관성이 없는 콘텐츠를 생성하는 LLM에 의해 생성되는 내용을 광범위하게 의미하는 것으로, 광범위한 영향력을 가지고 있다. 따라서 LLM 허구 감지를 감지하고 이러한 감지기 평가를 위해 설계된 벤치마크 데이터 세트를 디자인하는 데에 크게 노력한 바 있다. 이 연구에서, 우리는 허구 감지 벤치마크(HDB)의 효과적인 평가를 위해 보여주어야 하는 속성의 필요

에이전트 5월 6일

진료Bot: 가이드라인 기반의 의료 대화 챗봇

의료 진단에 정확하고 검증 가능한 답변이 필요합니다. 그러나 대규모 언어 모델(LLM)은 의료 분야에서 정확성이 중요할 때 허구를 생성하는 경향이 있습니다. 기존의 검색-추가-발생(RAG) 시스템은 모든 증거를 동일하게 다루어 noise한 문맥과 의료 관행과 일치하지 않는 일반적인 답변을 생산합니다. 이에 대한 해결책으로 진료Bot을 제시합니다.

LLM PC 5월 4일

토큰 아레나: 지속적인 벤치마크가 AI 추론에서 에너지와 인지성을 통합하는 것

토큰 아레나는 AI 시스템을 모델과 제공자 수준에서 비교하는 공공 추론 벤치마크와 달리, 실제로 배포 결정을 내리는 단위는 엔드포인트입니다. 엔드포인트는 특정 양자화, 디코딩 전략, 지역, 그리고 서빙 스택이 노출되는 (제공자, 모델, 재고 관리 단위) 튜플입니다. 이 연구에서는 5개의 핵심 축(출력 속도, 첫 번째 토큰까지의 시간, 작업 부하 혼합 가격, 실제 컨텍스트, 그리고 라이브 엔드포인트에서 품질)에서 추론을 측정하고, 이들을 합쳐 모델링된 에너지 추정과 함께 3개의 주요 합성물로 통합하는 지속적인 벤치마크인 토큰 아레나를 소개합니다. 이들 합성물은 1) 1주에 해당하는 에너지, 2) 1달에 해당하는 비용, 3) 엔드포인트의 신뢰도(출력 분포가 첫 번째 파티의 참조와 얼마나 유사한지)를 나타냅니다. 이 연구의 새로운 점은 경험적이고 방법론적인 측면입니다. 78개의 엔드포인트가 12개의 모델 가족을 제공하는 동안, 동일한 모델이 다른 엔드포인트에서 평균 정확도가 수학 및 코드에 대해 최대 12.5점, 첫 번째 파티의 인식률과 최대 12점, 꼬리 지연 시간이 10배, 그리고 모델링된 1주에 해당하는 에너지가 6.2배 차이가 나게 됩니다. 추가적으로, 작업 부하에 대한 혼합 가격이 리더보드의 순위를 크게 바꿔줍니다. 3:1의 입력:출력 비율이 있는 채팅 프리셋에서 10위 안에 있는 7개의 엔드포인트는 20:1의 리트리벌-증가 프리셋에서 10위 밖으로 떨어지며, 1:5의 사유 프리셋은 채팅 프리셋에서 비용으로 페널티를 받는 프론티어 클로즈 모델을 상승시킵니다.

에이전트 5월 1일

자기 치유 멀티 에이전트 AI를 통해 자동화된 ML 파이프라인 생성: 생각하고 실행하라

연구진은 데이터셋과 자연어 목표를 기반으로 end-to-end 머신 러닝(ML) 파이프라인 생성을 자동화하는 unified 멀티 에이전트 아키텍처를 개발하기 위해 연구를 수행했습니다. 이 아키텍처는 효율성, 강인성 및 설명 가능성을 향상시킵니다. 5개의 에이전트 시스템을 제안하여 프로파일링, 의도 파싱, 마이크로 서비스 추천, 지시 그래프(DAG) 생성 및 실행을 처리합니다. 코드 기반의 Retrieval-Augmented Generation(RAG)과 Large Language Model(LLM)-기반 오류 해석 및 실행 기록을 기반으로 적응 학습을 사용하는 자기 치유 메커니즘을 통합합니다. 연구는 150개의 ML 태스크를 포함하는 다양한 시나리오에서 평가되었습니다. 시스템은 baseline 방법을 초과하는 84.7%의 end-to-end 파이프라인 성공률을 달성했습니다. 또한 자기 치유와 함께 강인성을 향상시키고 수동 생성보다 워크플로 개발 시간을 줄였습니다. 연구는 코드 기반 RAG, 설명 가능한 추천, 자기 치유 실행 및 적응 학습을 단일 아키텍처에 통합하는 새로운 통합을 소개합니다..tightly coupled intelligent components가 isolated solution보다 뛰어난 성능을 나타낼 수 있음을 보여줍니다.

에이전트 4월 28일

AR-LLM 사회 공학 공격에 대한 심리적 프레임워크: PhySE

AR-LLM-SE 공격(예: SEAR)은 실세계 사회 상호 작용에 대한 심각한 위협을 야기한다. 이 공격에서 악의적인 공격자는 AR 글래스를 사용하여 목표를 포착하고 대규모 언어 모델(LLM podrob을 사용하여 이 데이터를 분석하여 개인을 식별하고 세부적인 사회 프로필을 생성한다. LLM-기반 에이전트는 사회 공학 전략을 사용하여 실시간 대화 제안을 제공하여 목표의 신뢰를 얻고 최종적으로 자물쇠 또는 다른 악의적인 행동을 수행한다. 그러나 AR-LLM-SE의 실제 적용은 두 가지 주요 장애물에 직면한다. (1) 냉각화 개인화, 현재 RAG 방법은 초기轮에서 중요한 지연을 유발하여 초기 프로파일 형성과 실시간 상호 작용을 방해한다. (2) 정적 공격 전략, 기존 방법은 수동으로 제작된 사회 공학 전략에 의존하여 정립된 심리학 이론에 기반을 두지 않는다. 이러한 제한을 해결하기 위해 우리는 PhySE라는 새로운 프레임워크를 제안한다. 두 가지 주요 혁신이 있다. (1) VLM-based SocialContext Training, 프로파일링 지연을 제거하기 위해 우리는 사회-컨텍스트 데이터를 사용하여 Visual Language Model(VLM) 을 효율적으로 미리 훈련한다. 초기 프로파일 생성과 실시간 상호 작용을 지원한다. (2) Adaptive Psychological Agent, 우리는 목표 반응에 따라 다양한 심리학 전략을 동적으로 배포하는 심리학 LLM을 소개한다. 기존의 정적, 수동으로 제작된 스크립트를 넘어간다.

AI 모델 4월 23일

AML 추계에 대한 설명 가능한 LLM 접근: 증거 검색 및 대체사례 검증

AML 추계는 대규모 언어 모델(LLM)을 이용하여 다양한 증거를 요약하고 합리화를 작성할 수 있지만, 규제된 워크플로우에서 무제한적 생성은 허구, 약한 증거, 그리고 내재된 결정에 대한 충실하지 않은 설명을 유발할 수 있다. 본 연구에서는 AML 추계를 증거 제한된 결정 과정으로 다루는 설명 가능한 AML 추계 프레임워크를 제안한다. 본 연구에서는 (i) 정책/유형 지침, 고객 맥락, 경보 트리거, 거래 서브그래프에서 증거를 추출하는 검색-augmented 증거 집합, (ii) 명시적인 인용과 지원하는 것과 반대하거나 누락된 증거를 구분하는 구조화된 LLM 출력 계약, (iii) 최소한의可能性가 있는 변동이 추계 추천과 합리화에 대한 일관된 변화를 유발하는지 검증하는 대체사례 검증을 포함한다. 본 연구에서는 공공의 합성 AML 벤치마크 및 시뮬레이터에서 평가하고 규칙, 표자 및 그래프 기반 머신러닝, LLM-only/RAG-only 변형과 비교한다. 결과는 증거 기반으로 하기 때문에 감사 가능성이 크게 향상되고 숫자 및 정책 허구 오류가 감소한다는 것을 보여주며, 대체사례 검증 또한 결정과 관련된 설명 가능성과 내구성이 더 크게 향상한다. 이 결과는 AML 추계에 대한 규제 요구 사항에 대한 충เทคโนโลย을 제공하는 지배가 가능한, 검증 가능한 LLM 시스템이 실용적인 결정 지원을 제공할 수 있음을 나타낸다.

에이전트 4월 15일

메모리와 대사: 동반 지식 시스템 설계

연구진은 대규모 언어 모델(LLM)의 지속적인 메모리를 위한 패턴으로 Retrieval-Augmented Generation이 지속되고 있지만, 2026년 4월에 개인 위키 스타일의 메모리 아키텍처가 나타났습니다. 이 아키텍처는 LLM Wiki v2, MemPalace, Karpathy의 설계 제안으로 지식에 대한 정보를_LONG_TERM_USE_하기위한 연결된 아티팩트로 컴파일합니다. 이 아키텍처는 단일 사용자에 의해 LONG_TERM_USE_되는 지식에 대한 연결된 아티팩트로 컴파일합니다.

에이전트 4월 14일

인공지능 에이전트의 지속적인 정체성: 탄력적인 기억과 연속성을 위한 다중 앵커 아키텍처

인공지능 에이전트의 지속적인 정체성 문제: 탄력적인 기억과 연속성을 위한 다중 앵커 아키텍처 현대 인공지능 에이전트는 근본적인 정체성 문제를 겪고 있다. 컨텍스트 윈도우가 넘치고 대화 기록이 요약될 때 에이전트는 정보뿐만 아니라 자아의 연속성을 잃게 된다. 이 기술적 한계는 더 깊은 아키텍처적 결함을 반영한다. 인공지능 에이전트의 정체성은 단일 메모리 저장소에 중앙화되어 있기 때문에 단일 실패 지점을 만든다. 인간 기억 장애의 신경학적 사례 연구를 참고하여, 우리는 인간 정체성이 왜 다중

인기 태그