본문으로 건너뛰기

#AI 에이전트

956개의 기사

에이전트 7월 13일

확률적 분포 변화에 대한 장기적 행위자 컨텍스트 진화에 대한 신뢰할 수 있는 범위 내 검증

deploy된 대규모 언어 모델(LLM) agent는 운영 장치에 의해 조합된 모델 외부 텍스트 제어 내용인 에이전트 콘텍스트에 의존한다. 본 연구에서는 모델, 도구 및 운영 장치가 고정된 상태에서 운영 경험으로부터 지속적인 시스템 수준 명령을 업데이트하는 mutable 컴포넌트가 에이전트 콘텍스트의 mutable 구성 요소가 된다. 긴 진화 시각에서 평평한 텍스트 유지 관리는累적된 지침이

에이전트 7월 13일

KV-PRM: 멀티 에이전트 테스트 타임 스케일링을 위한 KV 캐시 전송을 통한 효율적인 프로세스 보상 모델링

PRM(Process Reward Models)은 대규모 언어 모델(LM)-기반의 다중-agent 시스템의 능력을 크게 향상시키는 테스트 시간 확장(TTS) 방법을 지시하는 데 매우 효과적입니다. 그러나 현재의 PRM은 모두 텍스트 기반입니다. 즉, 테스트 트레이너 텍스트를 처음부터 다시 인코딩합니다. 긴 다중 agent 롤아웃에서, 점수 비용은 길이 L에 대한 제곱과 관련이 있어, 계산 비

에이전트 7월 13일

다중-agent 토론 구조의 법적 추론 평가 시스템: L-MAD

multi-agent 토론 프레임워크인 MAD framework는 일반적인 사고력에서 큰 잠재력을 보였지만, 구조가 복잡하고 지식이 많은 법률 영역에서 그 효과는 여전히 미흡하다. 본 연구에서는 법률 텍스트 인식에서 다양한 토론 구조와 집계 방법을 체계적으로 평가하는 법률 multi-agent 토론(L-MAD) framework를 소개한다. 여러 agent들에게 고유한 전문가 역할을 assi

에이전트 7월 13일

신경망 기제 제어: 신경망 기반 LLM 구동 기제 인공지능 프레임워크를 이용한 보안 제어의 제어

산업 IoT 환경에서 전통적인 규칙 기반 모니터링의 한계를 드러내며, 운영 기술에 대한 사이버 공격이 점점 더 비용이 많이 들고 물리적인 손상을 일으키고 있습니다. 강력한 의미적 추론 능력을 가지고 있는 대규모 언어 모델(LLM)은 의사결정 지원을 돕지만, 폐쇄 루프 제어에서 불안정한 안전 책임을 나타내는 환각적인 성격을 가지고 있습니다. 이 논문은 LLM 기반 계획자와 미리 훈련된 시계열

에이전트 7월 13일

ARCANA: 반사적 다중 agent 프레임워크, ARC-AGI-2 논리 추론을 위한 프로그래밍 합성 도구

ARCANA는 제한된 시간과 하드웨어 자원 하에서 ARC AGI 2 과제를 해결하기 위한 협력적인 다중 agent 프레임워크입니다. ARCANA는 각 과제를 반복적 인 감각, 가설 생성, Symbolic 실행, 그리고 반사적 개선으로 분해합니다. 감각 기반 agent는 raw grids에서 raw grids를 object 중심의 scene 그래프로 변환하고, latent program policy는 다양한 DSL 프로그램을 제안하며, symbolic executor는 후보 프로그램을 demonstration에 대한 verification을 통해 검증하고, reflective agent는 다음 턴에 대한 failure-driven feedback를 제공합니다. 이러한 agent는 shared differentiable blackboard를 통해 서로 의사소통하고, learned meta controller에 의해 스케줄링됩니다. 이 설계는 구조화된 프로그램 탐색과 적응적인 다중 턴 수정을 결합하여 challenging abstract transformation 과제에서 논리 추론 효율성과 솔루션 품질을 향상시킵니다.

에이전트 7월 13일

AI가 도와주는 Lean Formalization의 전략 게임: 비라소프 방정식의 평균 필드 유도

AI 기술을 활용하여 Lean 4 증명 도우미를 통해 비라소프 방정식의 평균 필드 유도에 대한 연구 결과를 공식화했습니다. 이 게임의 목표는 LaTeX 문서를 Lean으로 변환하는 것입니다. 개발이 컴파일되며, sorry가 없으며, 기계 검증이 목표 정리만 Lean의 기초 axioms에 의존하는지 확인하면 게임이 끝납니다. 재사용은 두 번째 검증입니다. 개발이 더 넓은 라이브러리가 흡수할 수 있는 일반적인 수학의 독립된 층을 제공하는지 확인합니다.

에이전트 7월 13일

장기 목표 지표 벤치: 장기 목표 지표를 위한 분자 보상 평가를 위한 agent의 한계를 시험하는

인공지능 agent는 짧고 명확한 작업을 자율적으로 완료할 수 있게되었습니다. 그러나 현재의 종결 벤치점은 간단한 문제에 초점을 맞추고 1분 이내에 완료되며, 최종 결과만 평가하는 것이 일반적입니다. 이러한 설정은 중간 진행과 부분적인 해결책을 무시하고, 희박한 보상 신호와 agent의 능력을 완전히 이해하지 못하게 합니다. 장기 목표 지표 벤치를 통해, 우리는 9개의 카테고리 (실험 재현, 소프트웨어 공학, 멀티 모달 분석, 인터랙티브 게임, 과학적 계산)로 구성된 46개의 장기 목표 지표 작업을 소개합니다.

에이전트 7월 13일

그래프 증강 tree 검색 및 층별 월드 모델을 이용한 효율적인 agent 계획

대규모 언어 모델(LLM)-agent는 단계별 계획 작업에서 hứ부를 보여주었지만, 존재하는 접근법인 언어 에이전트 트리 서치(LATS)와 ReAct는 계획 중에 LLM 추론에 의존하여, 높은 컴퓨팅 비용과 확률적 행동을 초래한다. 우리는 GATS (그래프 증강 트리 서치)라는 계획 프레임워크를 제시한다. GATS는 체계적인 UCB1 기반 트리 서치와-layered 월드 모델을 결합하여, 추

LLM PC 7월 10일

offline 에이전트 정렬을 위한 이뭄레이션 학습을 위한 피드백 조작 규제

강화 학습(RL) 연구는 점점 더 인간 가치에 부합하는 행동을 배우도록 보장하는 동맹에 초점을 맞추고 있습니다. 인간의 시범과 피드백은 동맹에 중요했지만, 언어 생성에 대한 문맥적 밴디트 프레임을 위한 다단계 pipe라인을 주로结合하여 동맹을 위한 기존 접근법은 주로 인간의 시범과 피드백을结合합니다. 그러나 이러한 보완적인 입력들이 단일 단계 오프라인 학습을 위한 더 풍부하고 상호 연결된 신

에이전트 7월 10일

인격적 인공지능(Agentive AI)과 수집 확장 모델의 직관적 기관 보험 심사

인공 지능(AI)은 특히 구조화되지 않은 문서, 다양한 데이터 원천, 규제된 결정 워크플로가 필요하는 영역에서 actuaries의 실무를 재편하고 있습니다. actuaries는 지금까지의 전통적인 규칙 기반 자동화부터 대규모 언어 모델(LLM), 검색 증강 생성(RAG), 다중 에이전트 '이기적인' 시스템까지 다양한 설계 공간을 마주하고 있습니다. 이 시스템은 계획, 검색, 도구 호출, 반영

연구 7월 10일

인간과 큰 언어 모델의 모임을 위한 적대적 사회적 지식론

본 논문에서는 대규모 언어 모델(LLM)을 포함한 밀접한 상호작용을 통해 의사소통하는 환경에서 공공 선언이 증거, 추론, institutions, 그리고 묵시적인 신뢰를 통해 체계화된 체인으로 지원되는 사회적 지식론을 제시한다. 이러한 환경에서 agent는 사적인, 명성, 연설, 물질적 이익을 위해 정보를 왜곡, 색칠, 누락, 조작, 또는 전략적으로 정보를 특정하지 않도록 유도하는 유인이 있

에이전트 7월 9일

작업 재구조화와 승인-구조화된 위임: 다중 agent LLM 안전성

다중 agent 대규모 언어 모델(LLM) 시스템의 안전성 평가에서 계획자-수행자 PIPELINE과 직접적인 명령어를 비교하여 결과를 단일 'PIPELINE 효과'로 보고하는 것은 어려울 수 있다. 왜냐하면 이 합계는 세 가지 메커니즘을 혼동시키기 때문이다: 해로운 의도는 합리적인 작동 작업으로 재구성될 수 있으며, 계획자는 요청을 거부하거나 변형할 수 있으며, 수행자는 이전 승인 impli

에이전트 7월 9일

인간 크기 이상의 지능 측정

인공지능의 지능을 인간 능력 이상으로 측정하는 방법은 무엇일까? 인간이 만든 기준을 사용하면 saturate(포화상태에達하는)되고, 인간 능력 이상의 지능을 측정하려면 hard(어려운)한 task와 verifiable(확인할 수 있는)한 task를 판별하는 방법을 모른다. 우리는 이러한 어려움은 절대적 평가의 본질적 특성이라고 주장하고, 상대적인 측정을 기반으로 한 새로운 패러다임을 제안한다

AI 모델 7월 9일

동적 인간-AI 협조에서 사회적 규범 학습이 호환성을 향상시킨다.

인간은 동적 상호작용을 통해 끊임없이 다른 사람들과 협력한다. 이 협력을 위한 암묵적인 사회 규범이-agent들이 공유하는 암묵적인 기대라는 점에서-hard-to-quantify social norms라고 불리우며, 이 규범은 상호작용하는 agent들 사이에서 작용한다. 인공지능 agent들, 특히 대규모 언어 모델(LLMs)은 일상생활에 점점 더 깊숙이 들어가며 이러한 상호작용에 참여하고

LLM PC 7월 9일

기업형 기관적 인공지능의 토큰 경제학을 설정하는 오케스트레이션 디자인 효과

현재 에이전트 AI 개발은 토큰을 최대화하는 방식으로 진행된다. 즉, 토큰을 사용하여 기능을 구매하는 방식으로, 더 긴 추론 경로, 더 많은 회전, 더 넓은 도구 로드, 더 큰 재생된_contexts를 얻기 위해 토큰당 작업의 가치가 증가하는 속도보다 토큰당 작업이 더 빠르게 증가한다. 토큰당 가격이 하락함에 따라 이 패턴은 드러나지 않지만, 총 지출은 여전히 증가한다. 우리는 토큰을 최대화

에이전트 7월 9일

SageMath-증강 LLM agent를 사용한 계산 및 실험 수학의 평가

수학 분야에서 AI를 이용한 최근 성과는 주로 자동 공식화와 정리 증명에 집중되어 왔다. 그러나 대규모 언어 모델(LLM)에서 컴퓨터 대수 시스템(CAS)의 역할은 아직 충분히 연구되지 않았다. 우리는 SageMath에서 얻은 검증 가능한 feedback와 Context7의 최신 문서를 결합한 ReAct-style 대인적인 설정을 제안한다. 또한 RealMath 벤치마크에서 연구 수준의 수학

인기 태그