본문으로 건너뛰기

#AI 에이전트

963개의 기사

에이전트 4월 28일

Analytica: 강력하고 확장 가능한 LLM-기반 분석을 위한 소프트 프로포지셔널 리저닝

Analytica는 소프트 프로포지셔널 리저닝(SPR) 원칙에 기반한 새로운 에이전트 아키텍처를 소개합니다. SPR은 복잡한 분석을 구조화된 프로세스로 재정의하여, 추정 오류의 편향과 분산을 공식적으로 모델링하고 최소화할 수 있습니다. Analytica는 이 원리를 통해, 병렬 및 분할-공격 프레임워크를 사용하여 오류의 두 가지 출처를 시스템적으로 줄입니다.

에이전트 4월 28일

LLM이 그래프를 읽지 말고 그래프가 생각하라

연구진은 협력적 다중 에이전트 사고를 위한 LLM의 성능을 향상시키기 위해PLICIT BELIEF 그래프를 조사했습니다. 연구 결과, 그래프가 LLM의 성능을 향상시키는지 여부는 통합 아키텍처에 달려있다고 밝혔습니다. 또한, 연구진은 LLM이 부분 competence에서 올바른 계획자 추천을 무시하는 '플래너 대항' 현상을 발견했습니다.

에이전트 4월 28일

인간의 개입을 통한 제어된 자율성: 분리된 인간-InThe-Loop 시스템

인간의 개입이 안전하고 제어된 자율성을 위해 중요하다는 점을 이미 증명한 AI 에이전트가 작업 흐름 내에서 태스크를 수행하고 결정을 내리며, 인간의 감독이 투명성, 책임성, 신뢰성 확보를 위해 중요하다는 점을 강조합니다. 그러나 현재의 인간-InThe-Loop(HITL) 메커니즘은 일반적으로 응용 프로그램 논리 내에 내장되어 재사용, 일관성, 대규모 에이전트 환경에서의 확장성이 제한됩니다.

에이전트 4월 28일

병렬 탐색 에이전트로 복잡한 텍스트-SQL 생성

현재 텍스트-SQL 생성에서 latency-performance trade-off 문제를 해결하기 위해, 연구팀은 텍스트-SQL 생성을 소프트웨어 테스트 커버리지의 프레임워크로 재구성했습니다. 이 프레임워크는 원래 쿼리를 더 간단하고 원자적 SQL로 구성된 테스트 케이스 스위트와 함께 준비하고, 테스트 케이스 커버리지가 충분히 완료된 후에 최종 SQL을 생성합니다. 이 프레임워크를 사용하여 연구팀은 Spider 2.0라는 최신 텍스트-SQL 벤치마크에서 70.2%의 실행 정확도를 달성하며, 새로운 최고 성능을 기록했습니다.

에이전트 4월 27일

인공지능 사회의 집단 지_iface를 평가하기 위한 초능력자 테스트: 집단 지능을 평가하기 위한 탐색자(agent)로 인공지능 사회를 평가하기

인공지능 사회의 집단 지능을 평가하기 위한 초능력자 테스트: 집단 지능을 평가하기 위한 탐색자(agent)로 인공지능 사회를 평가하기 집단 지능은 단일 개인이 달성할 수 없는 결과를 달성할 수 있는 집단의 능력을 말합니다. 대규모 언어 모델(agent)들이 수백만 명의 인구에 도달할 때, 집단 지능이 스케일로부터 자연스럽게 발생하는지 여부에 대한 열쇠 질문이 arises합니다. 우리는 대규모 자율 에이전트 사회를 평가하기 위한 첫 번째 경험적 평가를 제시합니다. 몰트북(MoltBook)을 연구한

에이전트 4월 27일

스킬에서 재능으로: heterogenous agent를 조직하는 실제 세계 회사

AI 시스템은 단순히 여러 개의 스킬과 도구를 통합하는 것만으로는 충분하지 않습니다. 우리는 각종 단점으로 인해 multi-agent 시스템이 제한된다는 것을 발견했습니다. 이러한 단점을 보완하기 위해, 우리는 OneManCompany(OMC) framework를 제안합니다. OMC는 agent의 자격, 도구, 실행 설정을 포트 able agent identities로 encapsulate하여, typed organisational interfaces를 통해 orchestrating합니다. 이는 heterogeneous backends를 abstract하여, community-driven Talent Market를 통해 on-demand recruitment을 허용합니다.

에이전트 4월 27일

AI 에이전트 검색 벤치마크: AgentSearchBench

AI 에이전트가 성장하고 있는 가운데, 복잡한 작업이 위임되고 실행되는 방식이 변하고 있습니다. 이에 따라, 특정 작업에 적합한 에이전트를 식별하는 새로운 도전이 발생했습니다. 에이전트의 기능은 종종 합성적이고 실행에 의존적이기 때문에, 텍스트 설명만으로는 에이전트를 평가하기가 어렵습니다. 그러나 기존 연구와 벤치마크는 보통 잘 정의된 기능성, 제어된 후보자 풀, 또는 실행 가능한 작업 쿼리만을 가정합니다. 따라서, 실제 에이전트 검색 시나리오가 충분히 연구되지 않았습니다. 본 연구에서는 AgentSearchBench라는 대규모 벤치마크를 제시합니다. 이 벤치마크는 10,000개 이상의 실제 에이전트를 포함하고 있으며, 다수의 제공자에서 가져와 보았습니다. 벤치마크는 에이전트 검색을 수행하는 retrieval 및 reranking 문제로 formalize하고, 실행 가능한 작업 쿼리 및 고급 작업 설명 모두를 고려합니다. 또한, 실행에 기반한 성능 신호를 사용하여 relevance를 평가합니다. 실험 결과, 의미적 유사성과 실제 에이전트 성능 사이에 일관된 격차가 나타났습니다. 이로 인해, 설명 기반 retrieval 및 reranking 방법의 한계가 드러났습니다. 또한, lightweight behavioral signals, 즉, 실행에 의한 probing을 사용하면 ranking quality를 크게 향상시킬 수 있으며, 에이전트 발견에서 실행 신호를 포함하는 중요성을 강조합니다.

에이전트 4월 27일

메멘토: 유형식 의미 기억과 정보 이론적 검색을 위한 장기 수명 에이전트

메멘토는 대규모 언어 모델(LLM) 기반의 에이전트 시스템에서 기억을 개선하기 위한 새로운 메모리 계층을 제안합니다. 메멘토는 유형식 의미 기억 스키마, 자동 충돌 해결 기구, 시간 버전 관리를 포함하고 있습니다. 이 시스템은 Moorcheh의 정보 이론적 검색 엔진을 사용하여 빠른 검색 속도와 낮은 연산 복잡도를 제공합니다.

에이전트 4월 27일

과학적 진실을 찾기 위한 적대적 실험의 필요성

대규모 언어 모델(LLM) 기반의 에이전트가 과학 데이터 분석을 자동화하고, 과학적 발견을 가속화하는 것으로 보이지만, 이는 또한 가짜 분석의 급속한 생산을 가속화하는 것일 수 있다. 이러한 분석은 선택적으로 선택된 분석을 통해 지원되는 가설 공간을 후보 주장으로 변환할 수 있다. 과학적 지식은 코드의 반복적 축적과 후속 통계적 지원으로 검증되지 않는다. 따라서 에이전트의 도움으로 생성된 비 실험적 주장의 진실성을 평가하기 위해 적대적 실험의 기준을 제안한다.

에이전트 4월 27일

논문 읽고 코드 쓰기: 사회과학 결과의 자기적 재생산

지금까지 대규모 언어 모델(LLM) 에이전트를 사용하여 데이터와 코드에 접근할 수 있는 사회과학 결과를 재생산하는 연구가 있었다. 하지만 만약에 논문에만 있는 방법 설명과 원래 데이터만 주어졌을 때, LLM 에이전트가 결과를 재생산할 수 있는지 궁금했다. 이 연구에서는 논문에서 구조화된 방법 설명을 추출하고, 원래 코드, 결과, 논문을 에이전트가 절대 보지 못하는 정보 분리 하에 리IMPLEMENT에이션을 실행하는 자기적 재생산 시스템을 개발했다. 또한, 에이전트가 재생산한 결과와 원래 결과를 셀 수준으로 비교하고, 불일치의 원인을 추적할 수 있는 오류 분포를 위한 단계를 추가했다. 4개의 에이전트 scaffold와 4개의 LLM를 48개의 논문에 대해 인간이 검증한 재생산 가능성을 평가한 결과, 에이전트가 largley 원래 결과를 재생산할 수 있지만, 모델, scaffold, 논문에 따라 성능이 크게 차이가 난다는 것을 발견했다. 불일치의 원인을 분석한 결과, 에이전트의 오류와 논문 자체의 미분명함이 실패의 원인이라는 것을 밝혔다.

에이전트 4월 27일

자동화된 약물 분자 평가, 검출 및 최적화 위한 MolClaw: 계층적 스킬 아키텍처

약물 분자 평가, 검출 및 최적화라는 복잡한 워크플로우를 처리하기 위해 여러 도구를 조정해야 하는 컴퓨터 약물 발견에서 AI 에이전트가 장기적으로 안정적인 성능을 유지하고 고급 복잡성 시나리오에서 일관되게 성능이 좋지 않다는 문제가 있습니다. MolClaw는 약물 분자 평가, 검출 및 최적화에 대한 자동화된 에이전트를 제시합니다. MolClaw는 30개 이상의 도메인 리소스를 통합하는 3단계 계층적 스킬 아키텍처(총 70개 스킬)가 있어 에이전트가 런타임에 장기적으로 상호 작용할 수 있습니다.

에이전트 4월 27일

의료 영상 처리를 위한 가변성 및 재현성의 도구 기반 에이전트 프레임워크

의료 영상 처리 연구는 실질적인 임상 배포로 전환하고 있는 추세입니다. 이러한 환경에서 분석 방법은 모델 설계를 넘어 데이터셋에 대한 워크플로 구성 및 증명성 추적을 필요로 합니다. 따라서 adaptability(가변성)과 reproducibility(재현성)라는 두 가지 요구 사항이 중심이 됩니다. 본 연구에서는 의료 영상 처리를 위한 도구 기반 에이전트 프레임워크를 제시합니다. 이 프레임워크는 의료 영상 처리에 대한 의미 있는 계층을 추가하여, artifact contract를 통해 중간 및 최종 출력을 공식화하고, 워크플로 상태 및 목적 조건에 따라 모듈러 규칙 라이브러리를 조합하여 구성할 수 있습니다.

에이전트 4월 24일

개인화된 물리치료를 위한 에이전트 AI: 생성적 비디오 교육 및 실시간 자세 교정을 위한 다중 에이전트 프레임워크

집에서 물리치료를 받는 아웃풋은 개인화된 감독과 동적 피드백 부족으로 인해 낮은 아웃풋을 보이고 있습니다. 기존의 디지털 헬스 솔루션은 정적, 미리 녹음된 비디오 라이브러리나 일반적인 3D 아바타를 사용하여 환자의 특정한 부상 제한이나 집 환경을 고려하지 못합니다. 이 논문에서는 생성적 AI와 컴퓨터 비전을 사용하여 의료재활 루프를 닫는 다중 에이전트 시스템 아키텍처를 제안합니다.

에이전트 4월 24일

마지막으로 बन낼 수 있는 Harness

인공지능(AI) 에이전트가 점점 더 복잡한 도메인에 특화된 워크플로우에서 배치되고 있다. 이 워크플로우는企業의 웹 애플리케이션을 탐색하고, 데이터를 추출하고, 합성하는 다단계 연구 파이프라인, 익숙하지 않은 저장소에서 코드 리뷰를 자동화하는 등 여러 가지 작업을 포함한다. 고객의 심각한 도메인 지식이 요구되는 고객의 프로세스 전환을 처리하는 등. \textbf{각각의 새로운 작업 도메인은 번거로운 전문가 주도적인 인프라 엔지니어링이 필요하다}: 작업을 수행하는 데 필요한 프롬프트, 도구, 오케스트

에이전트 4월 24일

장기 보수를 위한 LLM 의사결정 및 기술 은행 에이전트의 공동 진화

장기 보수를 위한 환경은 에이전트의 기술 사용 능력을 평가하는 데 적합한 테스트베드입니다. 이러한 환경은 다단계 논리 reasoning, 여러 스텝에 걸친 기술 연쇄, 지연 보상 및 부분 관찰 가능성 하에서 안정적인 의사결정을 요구합니다. 게임은 에이전트의 기술 사용을 평가하는 데 적합한 테스트베드입니다. 대규모 언어 모델(LLM)은 게임 플레이 에이전트로 유망한 대안을 제공하지만, 장기 보수 의사결정에 대한 일관된 성능을 달성하기 어렵습니다. 이는 에이전트가 에피소드 간에 구조화된 기술을 발견, 보존, 재사용하는 메커니즘을 갖고 있지 않기 때문입니다. 저자는 COSPLAY라는 공동 진화 프레임워크를 제안합니다. 이 프레임워크는 LLM 의사결정 에이전트가 기술 은행에서 기술을 검색하여 행동을 취하는 동안, 에이전트 관리 기술 파이프라인이 에이전트의 unlabeled rollouts에서 재사용 가능한 기술을 발견하여 기술 은행을 형성합니다. 이 프레임워크는 에이전트의 기술 검색 및 행동 생성 능력을 향상시키는 동시에, 기술 은행 에이전트가 기술과 그 계약과 함께 지속적으로 추출, 정제, 업데이트합니다.

인기 태그