본문으로 건너뛰기

#AI 에이전트

963개의 기사

에이전트 4월 14일

현실 세계 모바일 에이전트 성능 평가를 위한 모빌로우: 트라제로리 파이즈합

현실 세계 모바일 에이전트의 성능을 평가하기 위해 개발된 모빌로우는, GUI 인터랙션을 통해 사용자가 할당한 작업을 자율적으로 완료할 수 있습니다. 그러나 기존의 메인스트림 평가 벤치마크인 안드로이드 월드(AnderoidWorld)는 시스템 수준의 안드로이드 에뮬레이터에 연결하여 시스템 리소스의 상태에 기반한 평가 신호를 제공합니다. 그러나 실제 세계 모바일 에이전트 시나리오에서는, 많은 외부 애플리케이션들이 시스템 수준의 API를 노출하지 않아, 작업이 성공했는지 여부를 판단할 수 없기 때문에, 벤치마크와 실제 사용사례 간에 불일치가 발생하고, 모델 성능을 정확하게 평가하는 것이 어려워집니다. 이러한 문제를 해결하기 위해, 우리는 모빌로우를 제안합니다. 모빌로우는 임의의 외부 애플리케이션으로부터 태스크를 가져와 평가 프레임워크를 구축합니다. 다중 트라제로리 파이즈합을 기반으로 하는 효율적인 그래프 생성 알고리즘을 사용하여, 모빌로우는 상태 공간을 효과적으로 압축하고, 동적 인터랙션을 지원하며, 실제 세계 외부 애플리케이션 시나리오와 더 잘 일치합니다. 모빌로우는 20개의 널리 사용되는 외부 애플리케이션과 240개의 다양한 실제 세계 태스크를 포함하며, 풍부한 평가 지표를 제공합니다. 모빌로우의 평가 결과는 안드로이드 월드(AnderoidWorld)와 비교하여, 인간 평가와 더 잘 일치하고, 실제 작업 부하하에서 GUI 기반 모델을 훈련하는 데 도움이 됩니다.

에이전트 4월 14일

PDE 공간의 잠재 기반 모델을 사용한 매개변수화된 시뮬레이션을 위한 에이전트 탐색

유한 차원, 연속적인, 그리고 종종 혼란스러운 자연 현상인 유한 차원 Partial Differential Equations (PDEs) 및 유동 물리학을 다루는 연구자들은 일반적으로 실험실 실험 및/또는 계산적으로 비싼 수치 시뮬레이션을 사용하여 이러한 풍부한 공간-시간 PDE 해상 공간을 탐색했습니다. 이러한 방법은 자동화된 대규모 탐색을 제한하는 반면, 분리된, 토큰화 가능한 표현이 자연스럽게 대규모 언어 모델(LLM)과 인터페이스하는 영역인 약물 발견 또는 재료 과학과 같은 영역에서는 그렇

에이전트 4월 14일

오페플로: 시뮬레이션된 인간 웹 인터랙션을 통해 GUI 기반의 자동 UX 평가

오페플로: 시뮬레이션된 인간 웹 인터랙션을 통해 GUI 기반의 자동 UX 평가 웹 사용성 평가를 일반적으로 수행하려면 시간이 많이 걸리는 사용자 연구와 전문가 검토가 필요하며, 이로 인해 제품 개발 속도가 느려지며 특히 작은 팀과 안정적인 워크플로우에서 iteration 속도가 느려진다. 우리는 오페플로라는 사용자 경험 평가 에이전트를 제시하는데, 이는 사용자가 웹사이트에 접속하는 행동을 시뮬레이션하고 표준화된 사용성 평가를 제공한다. 전통적인 도구가 DOM 파싱에 의존하는 것과 달리, 오페플로

에이전트 4월 14일

고객 지원에 도움을 주고, 지속적인 자기 개선에 집중하는 대규모 클라우드 서비스 플랫폼의 온콜 지원 시스템

대규모 클라우드 서비스 플랫폼에서 고객 티켓이 매일 수천 개 생성되고 일반적으로 온콜 대화로 처리됩니다. 그러나 이러한 높은 온콜 상호 작용의 부하가 인간 지원 분석가에게 부과됩니다. 최근 연구에서는 대규모 언어 모델을 사용하여 고객과 직접 상호 작용하고 문제를 해결하는 데 사용되는 반응적 에이전트를 탐구했습니다. 그러나 문제가 해결되지 않고 인간 지원으로 전환되면 이러한 에이전트는 일반적으로 해제됩니다. 따라서 이들은 추후 질문에 도움을 주거나 해결 진행을 추적하거나 해결되지 않은 사례에서 학습할 수 없습니다. 이 논문에서는 Vigil이라는 새로운 전형적인 에이전트 시스템을 도입합니다. Vigil은 온콜 생애 주기 전반에 걸쳐 작동하는 에이전트 시스템입니다. 반응적 에이전트와 달리, Vigil은 인간 지원이 이미 관여한 단계에서 도움을 제공하는 데 중점을 둡니다. 고객과 분석가 간의 대화에 통합하여, Vigil은 명시적 사용자 호출 없이도 도움을 제공합니다. 또한, Vigil은 인간으로부터 해결된 사례에서 지식을 추출하여 자체적으로 능력을 업데이트하는 지속적인 자기 개선 메커니즘을 통합합니다. Vigil은 ByteDance의 클라우드 플랫폼 Volcano Engine에 10개월 이상 배포되어 existed되었으며, 이 배포를 기반으로 한 전반적인 평가 결과, Vigil의 효과성과 실용성을 입증했습니다. 이 작업의 오픈 소스 버전은 https://github.com/volcengine/veaiops에서 공개되어 있습니다.

에이전트 4월 14일

Troving Test on 스크린: 모바일 GUI 에이전트 인공화 능력 평가

이 연구에서는 모바일 GUI 에이전트가 인공화 능력을 갖출 수 있도록 하기 위해 'Troving Test on 스크린' 이라는 새로운 평가 지표를 제안합니다. 이 평가 지표는 에이전트가 자연스러운 동작을 구현하는지 여부를 평가합니다. 연구 결과, 대규모 언어 모델(LLM) 기반 에이전트는 자연스러운 동작을 구현하지 못하여 쉽게 감지됩니다. 따라서 연구에서는 에이전트 인공화 능력을 평가하기 위한 새로운 지표인 에이전트 인공화 능력 평가 지표(Agent Humanization Benchmark, AHB)를 제안합니다.

에이전트 4월 14일

AI 시스템이 생물학 연구를 수행하는 향상된 벤치마크: LABBench2

과학적 발견을 가속화하는 AI의 가능성에 대한 희망은 계속해서增长하고 있습니다. 현재 과학 연구에서 AI를 적용하는 범위는 과학 데이터에 대한 전용 기초 모델을 훈련하는 것부터 자율적 인 가정 생성 시스템까지 AI를 이용한 자율적 인 실험실까지 다양합니다. AI 시스템이 과학적 도메인에서 진행하는 진전을 측정해야 하는 필요성은 AI 시스템의 진전을 가속화하는 것뿐만 아니라 실제적인 실무 능력에 초점을 맞추는 것을 의미합니다. 단순한 지식과 그 이상의 추론을 실제로 의미 있는 작업을 수행할 수 있는

에이전트 4월 9일

에이전트게이트: 연결된 에이전트들의 인터넷을 위한 가벼운 구조화된 라우팅 엔진

최신 연구에서 에이전트 이름, 발견, 상호작용에 대한 개선이 이루어졌지만, 효율적인 요청 라우팅은 지연, 개인 정보 보호, 비용 제약 조건 하에서 여전히 개방된 시스템 문제로 남아있다. 에이전트게이트는 후보 에이전트 호출, 다중 에이전트 계획, 직접 응답, 안전한 격상과 같은 선택 가능한 액션을 결정하는 데 사용되는 라우팅을 구조화된 결정 문제로 형식화하고, 액션 결정과 구조화된 기반에 대한 두 단계로 분할한다.

에이전트 4월 9일

리소스-지향적 지식 압축: 다중 에이전트 강화 학습

다중 에이전트 강화 학습 시스템의 실제 세계 배포는 제한된 컴퓨팅 메모리, 인퍼런스 시간에 의해 제한됩니다. 전문가 정책은 높은 성능을 달성하지만 비용이 많이 드는 의사 결정 사이클과 대규모 모델에 의존하여 EDGE 장치나 임베디드 플랫폼에서 실용적이지 않습니다. 지식 압축은 리소스-지향적 실행에 대한 유망한 경로를 제공하지만 현재 다중 에이전트 강화 학습에서 지식 압축은 주로 행동 모방에 초점을 맞추고 조정 구조와 균일한 에이전트 능력을 가정하는 경우가 많습니다.

AI 모델 4월 9일

감정에 민감한 작은 언어 모델 에이전트의 의사결정

작은 언어 모델(SLM)은 점점 더 많은 상호작용적인 의사결정 에이전트로 사용되고 있지만, 대부분의 의사결정 평가에서는 감정을 의사결정에 영향을 미치는 요인으로 고려하지 않고 있습니다. 이 연구에서는 감정에 민감한 의사결정을 연구하기 위해 표현 수준에서 감정을 유도하는 데 사용되는 활성화 조정과 구조화된 게임 이론적 평가를 결합했습니다. 실세계 감정을 유발하는 텍스트를 사용하여 crowd-validated한 감정 유발 텍스트를 사용하여 감정 상태를 유도하는 데 사용됩니다. 이 연구에서는 대규모 언어 모델(LLM)과 같은 다양한 모델 가족을 사용하여 다양한 아키텍처와 모달리티에서 실험을 수행했습니다. 실험 결과, 감정적 변동이 전략적 선택에 영향을 미치지만, 결과된 행동은 종종 불안정하고 인간의 기대와 일치하지 않습니다. 마지막으로, 감정적 변동에 대한 강인성을 향상시키기 위한 접근 방식을 요약합니다.

산업 4월 8일

어트라슘, 콘플루언스에서 시각 AI 도구와 서드파티 에이전트 출시

어트라슘은 콘플루언스 사용자들이 소프트웨어 내에서 시각적 자산을 생성할 수 있도록 하며, 새로운 서드파티 에이전트가 Lovable, Replit, 및 Gamma와 함께 작동할 수 있도록 합니다. 이 새로운 기능은 콘플루언스 사용자들에게 더 많은 창의적이고 효율적인 방법으로 콘텐츠를 생성하고 관리할 수 있도록 합니다.

에이전트 4월 8일

순수한 CSI를 사용하지 않는 계층적 다중 에이전트强화 학습을 위한 재구성 가능한 반사기 학습

다중 에이전트 강화 학습을 이용한 계층적 CSI-free 네트워크 구축 다중파 초고주파 네트워크를 위한 지능형 라디오 환경 구축을 위한 반사면의 재구성 가능성은 큰 잠재력을 가지고 있다. 그러나 채널 상태 정보(CSI) 추정의 막대한 계산 부하와 중앙 집중식 최적화의 내재된 차원 폭발은 실용적인 대규모 배포를 막고 있다. 이러한 막대한 부하를 극복하기 위해, 우리는 계층적 다중 에이전트 강화 학습(HMARL) 아키텍처를 이용하여 기계적으로 재구성 가능한 반사면을 제어하는 CSI-free 패러다임

에이전트 4월 8일

CSI 병목 현상을 피하는 MARL-주도 공간 제어: 반사기 배열

다음세대 스마트 라디오 환경을 위한 재구성 가능한 지능형 표면(RIS)의 실제 배치가 채널 상태 정보(CSI) 추정의 불가피한 계산적 오버헤드에 의해 심각하게 지연되는 것을 방지하기 위해, 우리는 복잡한 채널 모델링을 공간 지능으로 대체하는 AI-자연적인 데이터 주도적인 패러다임을 제안합니다. 이 논문은 완전히 자율적인 다중 에이전트 강화 학습(MARL) 프레임워크를 제안하여 기계적으로 조정 가능한 금속 반사기 배열을 제어합니다. 사용자 좌표에 의존하는 협력 베어링 포커링 전략을 배우는 데 사용되는 다중 에이전트 근사 정책 최적화(MAPPO)를 사용하여, 우리는 분산 에이전트가 CSI-프리 작동을 달성하는 데 사용되는 중앙 집중식 훈련과 분산 실행(CTDE) 아키텍처를 배포합니다. 다중 에이전트 프록시미アル 정책 최적화(MAPPO)를 사용하여, 우리는 분산 에이전트가 CSI-프리 작동을 달성하는 데 사용되는 중앙 집중식 훈련과 분산 실행(CTDE) 아키텍처를 배포합니다. 동적 비선형 통신 환경에서 고해상도 레이 트레이싱 시뮬레이션을 통해, 다중 에이전트 접근법은 사용자 이동성에 대한 빠른 적응을 달성하여 최대 26.86 dB의 향상을 달성하고, 고정 평면 반사기에 비해 공간 선택성과 시간 안정성을 향상시킵니다. 또한, 학습된 정책은 1.0m 위치화 잡음에 대한 양호한 배포 내구성을 보유하고 있습니다. 이 결과는 AI-empowered 무선 네트워크로의 확장 가능한, 매우 실용적인 경로로써 MARL-주도 공간 추상화의 효능을 검증합니다.

에이전트 4월 8일

컴퓨터 사용 에이전트를 위한 의도-조건에 의한 행동 평가 시스템

컴퓨터 사용 에이전트를 위한 의도-조건에 의한 행동 평가 시스템(arXiv:2604.05157v1) 컴퓨터 사용 에이전트(CUAs)는 대규모 언어 모델을 사용하여 데스크톱 환경에서 GUI 연산을 수행하지만, 행동의 품질을 평가하지 않고 행동을 생성하는 결과로, 이후의 단계에서 불가피한 오류가 연쇄적으로 발생한다. 우리는 IntentScore라는 목적에 대한 계획에 대한 보상 모델을 제안한다. IntentScore는 3대 운영 체제를 포괄하는 398K개의 오프라인 GUI 상호 작용 단계를 기반

에이전트 4월 8일

의료진단 경로 학습을 위한 불확실성 가이드드 라텐트 디아그노스틱 트레잇로이

의료진단은 시간에 따라 불확실성 하에 증거를 순차적으로 수집하는 것을 필요로 합니다. 그러나 대부분의 대규모 언어 모델(LLM) 기반 진단 시스템은 완전히 관찰 가능한 환자 정보를 가정하고, 진단 경로가 시간에 따라 어떻게 순차적으로 수집되어야 하는지에 대한 명시적인 모델을 제공하지 않습니다. 진단을 순차적 의사결정 과정으로 규정한다 하더라도, 진단 경로의 가능한 공간이 상대적으로 크고, 의료 데이터 세트가 바람직한 진단 경로에 대한 명시적인 감독 정보를 제공하는 경우가 드물기 때문에 효과적인 진단 경로를 학습하는 것이 쉽지 않습니다. 이러한 문제를 해결하기 위해, 우리는 라텐트 디아그노스틱 트레잇로이 학습(LDTL) 프레임워크를 제안합니다. 이 프레임워크는 계획 LLM 에이전트와 진단 LLM 에이전트를 기반으로 하며, 진단 LLM 에이전트에서는 진단 동작 시퀀스를 라텐트 경로로 다루고, 진단 정보를 제공하는 경로를 우선화하는 포스터리오 분포를 도입합니다. 이 분포에 따라 평행한 계획 LLM 에이전트를 훈련하여, 일관된 진단 경로를 학습하고 불확실성을 줄이는 것을 목표로 합니다. MIMIC-CDM 벤치마크에서 실험 결과, 제안된 LDTL 프레임워크는 existing baseline 과 비교하여 진단 정확도를 향상시키며, 진단 테스트의 수를 줄입니다. 또한, 제거 연구는 라텐트 경로 수준의 포스터리오 평행성이 이러한 향상을 달성하는 데 중요한 역할을 하는지 강조합니다.

에이전트 4월 8일

자동화된 AI 연구 논문 작성을 위한 다중 에이전트 프레임워크: PaperOrchestra

자동화된 AI 연구 논문 작성을 위한 다중 에이전트 프레임워크: PaperOrchestra 논문 작성을 위한 연구 자료를 구조화된 문헌으로 변환하는 것은 AI를 이용한 과학적 발견의 중요한 과제 중 하나이다. 기존의 자율적인 작가는 특정 실험 파이프라인에 강하게 결합되어 있으며, 표면적인 문헌 검토만 수행한다. PaperOrchestra라는 다중 에이전트 프레임워크를 소개한다. 이 프레임워크는 논문 작성을 위한 자유로운 자료를 대량의 LaTeX 문헌으로 변환할 수 있으며, 문헌 검토 및 시각화(

에이전트 4월 8일

순차적 메타인지 판단에서 작동적 비가환성

순차적 메타인지 판단에서 작동적 비가환성 메타인지란 내 자신의认知 과정을 모니터링하고 조절하는 것을 의미한다. 이는 내부 상태를 평가하고 업데이트한 후, 수정된 기준으로 다시 평가하는 순차적인 과정을 포함한다. 인식에서 순차적 효과는 잘 문서화되어 있지만, 이러한 효과가 고전적인 상태 변화나 더 깊은 구조적 비가환성을 나타내는지 여부는 불분명하다. 우리는 이러한 구별을 명확히 하기 위해 작동적 프레임워크를 개발한다. 우리의 형식화에서 메타인지 평가는 내부 상태 공간에 대한 확률적 읽아웃을 통해

에이전트 4월 7일

인공지능 에이전트를 중심으로 프로세스 리디자인하는 방법

인공지능 에이전트는 정적 규칙 기반 시스템과 달리 학습, 적응, 최적화가 가능하며, 데이터, 시스템, 사람, 다른 에이전트와의 실시간 상호작용을 통해 전체 워크플로우를 자동으로 실행할 수 있습니다. 그러나 이러한 잠재력을 풀기 위해서는 기존의 최적화 방법을 사용하여 분산된 레거시 워크플로우에 에이전트를 부착하는 대신에 에이전트를 중심으로 프로세스를 리디자인해야 합니다.

인기 태그