본문으로 건너뛰기

#AI 에이전트

963개의 기사

LLM PC 5월 1일

간격 순서, 이중 순서 및 신뢰도 제한된 믿음 수정

의사 결정 이론에서 간격 순서와 이중 순서를 연구하고, 신뢰도 제한된 믿음 수정을 위한 새로운 접근법을 제안합니다. 간격 순서와 이중 순서를 사용한 믿음 수정은 총순서보다 더 일반적인 클래스의 순서를 사용하여 수행됩니다. 이중 순서를 사용한 믿음 수정은 성공 포스트룰 만족하지만, 항상 일관된 출력을 제공하지는 않습니다. 신뢰도 제한된 믿음 수정을 위한 새로운 가족을 제안하고, 신뢰도 제한된 믿음 수정과 이중 순서를 연결합니다.

에이전트 5월 1일

GUI 자동화 에이전트의 효율적인 사용을 위한 단계 수준 최적화

GUI 자동화 에이전트는 컴퓨터 소프트웨어 자동화의 유망한 방식으로, 그래픽 사용자 인터페이스와 직접 상호 작용할 수 있기 때문에 brittle한 애플리케이션 특정 통합에 의존하지 않습니다. 그러나 최근 성능 벤치마크에서 강력한 GUI 자동화 에이전트는 실제로 비용이 많이 들고 느려질 수 있습니다. 이 문제의 원인은 GUI 작업의 오랜 수직에서 대규모 멀티 모달 모델을 거의 모든 상호 작용 단계에서 호출하는 것입니다. 우리는 이러한 uniform한 컴퓨팅 할당이 GUI 작업의 오랜 수직에서 효율적이지 않다는 것을 주장합니다. 이러한 경로들은 매우 다양합니다: 많은 단계는 일상적이고 신뢰할 수있는 작은, 저렴한 정책으로 처리할 수 있습니다. 그러나 오류는 상대적으로 작은 수의 고위험 순간에 집중됩니다. GUI 자동화 벤치마크에서 이러한 실패는 두 가지 형태로 반복됩니다: 진행이 고정되면 에이전트는 루프, 반복적 인 비효율적인 동작, 또는 의미 있는 진행을 하지 못할 때, 그리고 침묵된 의미 드리프트는 에이전트가 이미 사용자의 실제 목표에서 벗어나지만 현지적으로 합리적인 동작을 계속하는 경우입니다. 이 문제를 해결하기 위해, 우리는 GUI 자동화 에이전트를 위한 이벤트 기반, 단계 수준의 계단을 제안합니다. 이 계단은 작은 정책을 기본으로 하며, 가볍게 학습된 모니터가 고위험을 감지할 때만 강력한 모델로 전환합니다.

에이전트 5월 1일

자기 치유 멀티 에이전트 AI를 통해 자동화된 ML 파이프라인 생성: 생각하고 실행하라

연구진은 데이터셋과 자연어 목표를 기반으로 end-to-end 머신 러닝(ML) 파이프라인 생성을 자동화하는 unified 멀티 에이전트 아키텍처를 개발하기 위해 연구를 수행했습니다. 이 아키텍처는 효율성, 강인성 및 설명 가능성을 향상시킵니다. 5개의 에이전트 시스템을 제안하여 프로파일링, 의도 파싱, 마이크로 서비스 추천, 지시 그래프(DAG) 생성 및 실행을 처리합니다. 코드 기반의 Retrieval-Augmented Generation(RAG)과 Large Language Model(LLM)-기반 오류 해석 및 실행 기록을 기반으로 적응 학습을 사용하는 자기 치유 메커니즘을 통합합니다. 연구는 150개의 ML 태스크를 포함하는 다양한 시나리오에서 평가되었습니다. 시스템은 baseline 방법을 초과하는 84.7%의 end-to-end 파이프라인 성공률을 달성했습니다. 또한 자기 치유와 함께 강인성을 향상시키고 수동 생성보다 워크플로 개발 시간을 줄였습니다. 연구는 코드 기반 RAG, 설명 가능한 추천, 자기 치유 실행 및 적응 학습을 단일 아키텍처에 통합하는 새로운 통합을 소개합니다..tightly coupled intelligent components가 isolated solution보다 뛰어난 성능을 나타낼 수 있음을 보여줍니다.

에이전트 5월 1일

실제 광학 플랫폼에서 종단 간 자율 과학적 발견

과학 연구는 오랜 시간 동안 인간이 주도적인 역할을 하였으며, 증거가 축적되는 동안 질문, 방법 및 주장의 지속적인 수정을 통해 새로운 지식과 혁신적인 기술을 구축해 왔습니다. 대규모 언어 모델(LLM)-기반 에이전트들은 정의된 연구 워크플로우를 지원하는 것 이상으로 진전되는 것이 있지만, 아직까지 실제 물리적 시스템에서 비트리거 결과를 지지하는 실험적 증거를 생산하는 종단 간 자율적 발견을 보여주지 못했습니다. 여기서 우리는 Qiushi Discovery Engine, LLM-기반 종단 간 자율

에이전트 4월 30일

AGEL-Comp: 인터랙티브 에이전트의 구성성 일반화에 대한 신경-기호학적 프레임워크

대규모 언어 모델(LLM)-기반 에이전트는 인터랙티브 환경에서 구성성 일반화에 대한 시스템적인 실패를 보이는데, 이를 해결하기 위해 AGEL-Comp라는 신경-기호학적 에이전트 아키텍처를 제안합니다. AGEL-Comp는 동적 원인-프로그램 그래프(CPG)와 인다ктив 로직 프로그래밍(ILP) 엔진, 그리고 하이브리드 사고 코어를 통합하여 에이전트가 구성성 일반화를 수행할 수 있도록 합니다.

에이전트 4월 30일

꿈과 잠을 통해 전이 가능한 명제 라이브러리를 증명하는 에이전트를 이용한 증명 라이브러리 진화

이 연구에서는 DreamProver라는 에이전트 프레임워크를 제시한다. DreamProver는 "wake-sleep" 프로그램 유도 패러다임을 사용하여 형식적 정리 증명에 쓰일 수 있는 재사용 가능한 명제 라이브러리를 발견한다. 기존 접근 방식은 고정된 명제 라이브러리에 의존하거나, 개별 정리에 맞게 매우 특정한 중간 명제를 합성한다. DreamProver는 이 틈을 두고 이터레이티브 두 단계의 과정을 사용한다. DreamProver는 wake 단계에서 현재 명제 라이브러리를 사용하여 훈련 세

에이전트 4월 30일

예측 요원들의 전략적 사고 능력 평가

예측 요원들의 전략적 사고 능력 평가를 위한 새로운 벤치마크를 제안했다. 이 벤치마크는 1,417 개의 과거 예측 문제를 사용하고 대규모 언어 모델(LLM)으로부터 15만 개의 문서를 사용하여 연구 및 예측을 reproducibly 수행한다. 이 벤치마크는 예측 요원들의 정확도 차이를 0.004 Brier score로 감지할 수 있으며, 연구 및 판단 차이점을 구별할 수 있다. 이 벤치마크를 사용하여, 예측 요원들의 전략적 사고 능력을 평가할 수 있다. 연구 결과, 더 좋은 예측 요원은 주로

에이전트 4월 30일

물리적 장에서 폐쇄 루프 역원소 위치화 및 특성화

물리적 장에서 폐쇄 루프 역원소 위치화 및 특성화(arXiv:2604.26095v1)가 필요로 하는 핵심 도전은 신뢰도 공간 목표에 있다. 신뢰도 공간 목표에서 유효한 불확실성 추정은 비용이 많이 드는 베이즈 추론이 필요하지만, 빠르게 학습된 신뢰도 모델을 사용하면 보상 해킹(reward hacking)이 발생한다. 보상 해킹은 정책이 실제로 불확실성을 줄이지 않고 근사 오류를 악용하는 것을 의미한다. 우리는 Distill-Belief라는 교사-학생 프레임워크를 제안한다. 교사 학생 분리를 통

에이전트 4월 30일

온체인 언어 모델 에이전트의 운영 계층 제어: 실질적인 자본 하의 신뢰성

온체인 언어 모델 에이전트가 사용자의 지시를 유효한 도구 동작으로 번역하는 신뢰성을 연구한다. 사용자들이 구조화된 제어와 자연어 전략을 통해 보유함을 구성했지만, 에이전트만이 정상적인 매수/매도 거래를 선택할 수 있었다. 시스템은 7.5M 에이전트 호출, 약 300K 온체인 액션, 약 $20M의 거래량, 5,000 ETH의 배포, 약 70B의 추론 토큰, 그리고 정책 유효한 제출 거래의 99.9%의 정산 성공률을 기록했다.

AI 모델 4월 28일

코ARSE에서 FINE으로: 자기적응형 계층적 계획을 통한 LLM 에이전트 개선

대규모 언어 모델(LLM) 기반 에이전트가 최근으로는 동적 및 다단계 태스크를 해결하는 강력한 접근법으로 등장했습니다. 대부분의 기존 에이전트는 계획 메커니즘을 사용하여 동적 환경에서 장기적인 행동을 안내합니다. 그러나 현재의 계획 접근법은 고정된粒度 수준에서 작동하는 한계를 가지고 있습니다. 즉, 단순한 태스크에 대한 과도한 세부 정보를 제공하거나 복잡한 태스크에 대한 충분한 세부 정보를 제공하지 못하여, 단순성과 복잡성의 적절한 균형을 달성하지 못합니다. 인지 과학의 extit{progressive refinement} 원칙에서 영감을 얻은 우리는 extbf{AdaPlan-H}, 대규모 언어 모델(LLM) 에이전트를 위한 자체 적응형 계층적 계획 메커니즘을 제안합니다. 이 메커니즘은 태스크의 복잡도에 따라 점진적으로 단순한 큰 범위의宏 계획을 개선합니다. 태스크의 난이도 수준에 맞춰진 자체 적응형 계층적 계획을 생성하고, 이메이션 학습 및 능력 향상을 통해 최적화할 수 있습니다. 실험 결과에서는 우리의 메서드가 계획 수준에서 과도한 계획을 완화하는 동시에 태스크 실행 성공률을 크게 향상시킵니다. 다단계 복잡한 의사 결정 태스크에 대한 유연하고 효율적인 해결책을 제공합니다.

에이전트 4월 28일

AR-LLM 사회 공학 공격에 대한 심리적 프레임워크: PhySE

AR-LLM-SE 공격(예: SEAR)은 실세계 사회 상호 작용에 대한 심각한 위협을 야기한다. 이 공격에서 악의적인 공격자는 AR 글래스를 사용하여 목표를 포착하고 대규모 언어 모델(LLM podrob을 사용하여 이 데이터를 분석하여 개인을 식별하고 세부적인 사회 프로필을 생성한다. LLM-기반 에이전트는 사회 공학 전략을 사용하여 실시간 대화 제안을 제공하여 목표의 신뢰를 얻고 최종적으로 자물쇠 또는 다른 악의적인 행동을 수행한다. 그러나 AR-LLM-SE의 실제 적용은 두 가지 주요 장애물에 직면한다. (1) 냉각화 개인화, 현재 RAG 방법은 초기轮에서 중요한 지연을 유발하여 초기 프로파일 형성과 실시간 상호 작용을 방해한다. (2) 정적 공격 전략, 기존 방법은 수동으로 제작된 사회 공학 전략에 의존하여 정립된 심리학 이론에 기반을 두지 않는다. 이러한 제한을 해결하기 위해 우리는 PhySE라는 새로운 프레임워크를 제안한다. 두 가지 주요 혁신이 있다. (1) VLM-based SocialContext Training, 프로파일링 지연을 제거하기 위해 우리는 사회-컨텍스트 데이터를 사용하여 Visual Language Model(VLM) 을 효율적으로 미리 훈련한다. 초기 프로파일 생성과 실시간 상호 작용을 지원한다. (2) Adaptive Psychological Agent, 우리는 목표 반응에 따라 다양한 심리학 전략을 동적으로 배포하는 심리학 LLM을 소개한다. 기존의 정적, 수동으로 제작된 스크립트를 넘어간다.

에이전트 4월 28일

객체 관계 데이터베이스 자동 생성을 위한 다중 에이전트 LLM 접근 방식

객체 관계 데이터베이스를 자동으로 생성하는 것은 지식 공학의 핵심 문제 중 하나입니다. 대규모 언어 모델(LLM)은 가능성을 보여주지만, 현재 접근 방식의 한계와 성공 요인을 파악하는 데 어려움이 있습니다. 본 연구에서는 도메인별 보험 계약을 사용하여 이 문제를 조사하는 통제 실험 연구를 수행했습니다. 첫 번째로, 단일 에이전트 LLM 기준선을 설정하고, 객체 디자인 패턴 준수, 구조적 중복, 반복적인 수정의 효과적인 수행을 위한 객체 관계 데이터베이스 생성의 주요 실패 모드를 식별했습니다. 두 번째로, 다중 에이전트 아키텍처를 도입하여 객체 관계 데이터베이스 생성을 네 가지 artifact-driven 역할로 분할했습니다: 도메인 전문가, 관리자, 코더, 품질 보증자. 아키텍처 품질과 기능적 사용성의 성능을 평가했습니다. 결과는 다중 에이전트 접근 방식이 구조적 품질을 크게 향상시키고, 상호 보완적인 검색-augmented 생성 평가를 통해 queryability를 약간 향상시켰습니다. 이러한 결과는 전면 계획-first, artifact-driven 생성이 대규모 자동 객체 관계 데이터베이스 공학의 지속 가능한 경로로 높여지는 것을 보여줍니다.

인기 태그