본문으로 건너뛰기

#AI 에이전트

963개의 기사

에이전트 5월 13일

시맨틱 트레이닝 격차: 제조 AI 에이전트 시스템을 위한 온톨로지 기반 도구 아키텍처

대규모 언어 모델(LLM)-기반 AI 에이전트가 제조 환경에서 분석, 품질 관리 및 의사결정 지원을 위해 점점 더 많이 배치되고 있습니다. 이 에이전트는 도메인 용어에 대한 통계적 유창성을 보여주지만, 특정 생산 맥락에서 장비 식별자, 프로세스 매개변수, 실패 코드 및 규제 제약과 관련된 관계적 구조인 운영 시맨틱스에 대한 기반 이해를 가지고 있지 않습니다. 이 문서는 시맨틱 트레이닝 격차를 식별하고 공식화합니다. 이 격차는 AI 시스템이 훈련을 통해 도메인 용어를 획득하는 방식과 제조 운영이 의미를 정의하는 온톨로지적 관계에 대한 구조적 불일치입니다.

에이전트 5월 13일

PIVOT: 계획과 실행을 연결하는 LLM 에이전트에서 경로 개선 방식

PIVOT: 계획과 실행을 연결하는 대규모 언어 모델(LLM) 에이전트에서 경로 개선 방식 대규모 언어 모델(LLM)-기반 에이전트는 종종 실행 시 비현실적인 행동, 제약 위반, 확장된 시간대에 누적된 오류로 인해 계획이 실패하는 것처럼 보이는 일관된 계획을 생성한다. PIVOT(Plan-Inspect-eVOlve Trajectories)는 계획-실행 불일치 문제를 해결하기 위해 환경 상호 작용을 통해 반복적으로 미세 тепло 작용하는 트래픽을 최적화하는 개체로 다루는 자가 지도 학습 프레임

AI 모델 5월 13일

OLIVIA: 배포 시점의 결정 과정에 대한 행동 적응을 위한 온라인 학습

대규모 언어 모델(LLM) 에이전트는 논리적 추론, 행동 선택, 관찰을 번갈아가며 시퀀셜 결정 과제를 해결합니다. 배포 설정에서 에이전트가 반복적으로 관련된 다단계 과제를 처리할 때, 작은 행동 선택 오류가 시간 낭비, 지연, 신뢰도 감소로 누적될 수 있습니다. existing inference-time adaptation methods for LLM agents mainly rely on prompting or retrieval, which influence behavior indirectly through context manipulation.

에이전트 5월 13일

코에볼루션 챔버: TEST-TIME 멀티 에이전트 시스템의 개인, 팀, 인구 규모에서의 동시 진화

멀티 에이전트 테스트 시간 진화는 단일 에이전트 진화의 N번 반복이 아니다. 단일 에이전트 학습자는 자신의 컨텍스트와 메모리만 진화할 수 있다. 멀티 에이전트 시스템은 누가 협력하고, 어떻게 협력하고, 인구에 걸쳐 지식이 흐르는지까지 진화한다. 이러한 구성 요소는 단일 에이전트에 해당하는 것이 없고, 협력의 가치가 있는 수평적 지식 전달을 제거하는 테스트 시간 메서드의 한계를 극복한다. 이 연구에서는 테스트 시간 진화의 세 가지 수준을 보유한 TRAINING-FREE 프레임워크인 EVOCHAMBER를 제시한다. 이는 CODREAM(Collaborative Dreaming)이라는 POST-TASK 프로토콜을 통해 팀이 실패하거나 의견이 달라질 때, 에이전트들이 협력하여 반영하고, 통찰력을 경쟁적으로 강한 에이전트에게 전달한다. 이는 협력의 가치를 보존하는 동시에 지식의 미흡한 부분을 채운다.

에이전트 5월 13일

메디케어의 새로운 지불 모델은 AI를 위해 설계되었고, 기술계의 대부분은 모르는 사실

메디케어의 새로운 지불 모델은 AI를 위해 설계되었고, 기술계의 대부분은 모르는 사실이다. 정부가 AI를 모니터링하거나 환자와 연락하거나 주거 추천을 조율하거나 약을 먹어야 하는 사람을 확인하는 등 환자와의 방문 사이에 AI 에이전트를 이용할 수 있는 방법이 없었다. ACCESS는 처음으로 이러한 방법을 제공한다.

산업 5월 12일

AI 음성 스타트업 Vapi, 40개 경쟁사에게 Amazon Ring을 이기고 5억 달러 평가액 달성

Vapi는 2025년 초부터 기업 사업이 10배 증가하여 고객 지원 및 판매 전화가 AI 에이전트로 이동함에 따라 대규모 언어 모델(LLM) 기술을 활용한 고객 지원 및 판매 서비스를 제공하고 있습니다. Vapi는 Amazon Ring을 제외한 40개 경쟁사에게 이길 수 있었던 이유는 AI 음성 기술의 뛰어난 성능과 대규모 언어 모델(LLM)의 능력 때문입니다.

에이전트 5월 12일

건강관리 AI를 위한 성능 측정: 생성적, 다모드, 그리고 주체적 AI를 위한 벤치마크

건강관리 AI를 위한 성능 측정은 복잡한 실세계 워크플로우에서 신뢰성, 안전성, 및 임상적 중요성을 측정하는 체계적인 방법이 부족하다. 대부분의 벤치마크는 모델이 무엇을 알고 있는지 테스트하지만, 실세계 임상 작업의 전체 복잡성을 고려한 신뢰성과 실패를 테스트하는 벤치마크는 부족하다.

연구 5월 12일

도구 확장 언어 모델을 위한 CoCoDA: 컴포지셔널 DAG의 공동 진화

도구 확장 언어 모델은 작은 언어 모델에 외부 실행 가능한 스킬을 추가할 수 있지만 도구 라이브러리를 확장하는 것은 새로운 재사용 가능한 서브루틴이 발생할 때 계획자와 함께 진화해야 하며, 검색은 고정된 컨텍스트 예산 내에서 유지해야 한다. 기존의 도구 사용 및 스킬 라이브러리 방법은 도구를 평평한 메모리나 텍스트 인덱스 메모리로 처리하기 때문에 라이브러리 크기에 따라 지시 첨부 비용이 증가하고, 실행 가능한 코드의 타입화된 컴포지셔널 구조가 묻힌다. 우리는 CoCoDA를 제안한다. CoCoDA는 컴포지셔널 코드 DAG를 통해 계획자와 도구 라이브러리를 공동 진화하는 프레임워크이다. 노드는 원소 또는 복합 도구로, 엣지는 호출 의존성을 인코딩하고, 각 노드는 타입화된 서명, 설명, 전/후 조건 사양, 예시를 저장한다. 추론 시간에, 타입화된 DAG 검색은 후보를 심볼릭 서명 일치로 필터링하고, 생존자들을 설명에 따라 순위 매기고, 행동 사양에 의해 필터링하고, 예시를 통해 불명확성을 해소한다. 이 때, 비용이 많이 드는 컨텍스트 재현을 점진적으로 작아지는 후보 집합에 유지한다. 훈련 시간에, 성공적인 경로를 유효화된 복합 도구로折입하고, 계획자는 DAG 유도된 보상을 사용하여 복합 도구의 원소 확장 크기에 따라 크레딧을 받는다. 우리는 검색 비용 감소, 선형 검색 시간, 형성된 보상 하에서 컴포지셔널 이점, 보수적인 업데이트하에 모노톤 공동 진화, DAG의 잘못된 형태를 보여준다. 수학적 논리, 표 형태 분석, 코드 작업 벤치마크에서, CoCoDA는 8B 학생이 GSM8K와 MATH에서 32B 교사와 일치하거나 초과하는 것을 허용하고, 강력한 도구 사용 및 라이브러리 학습 베이스 라인에 비해 지속적으로 개선한다.

에이전트 5월 12일

실렌스: 효율적인 LLM 에이전트를 위한 대규모 언어 모델(LLM) 경험 재사용

실렌스는 대규모 언어 모델(LLM) 에이전트가 다양한 태스크에서 절차적 경험을 재사용하는 데 있어 실용적인 방법이 되었다. 그러나 기존 시스템은 지식库를 단일 해상도 프롬프트 블록으로 다루어 왔기 때문에, 도식화된 지식은 관련성이 떨어지거나 오해를 일으킬 수 있지만, 전체 지식을 다시 작성하는 것은 비용이 많이 들고 자주 필요하지 않다. 실렌스는 지식 라이브러리를 네 개 층의 정책, 전략, 절차, 원소로 구성된 그래프에 조직하고, 다양한 해상도에서 지식을 검색하는 지식 진화 프레임워크를 제안한다. 태스크를 입력받으면, 실렌스는 의미적으로 관련된 지식 씨앗을 검색하고, 그 지식 씨앗을 확장하기 위해 지식 그래프에 대한 고도의 정정된 무작위 경로를 수행하고, 이후 각 방문 단위가 수락, 분해, 다시 작성, 건너뛰어야 하는지 결정하기 위해 검증기를 사용한다. 이로써 에이전트는 호환 가능한 서브 지식을 직접 재사용할 수 있으면서, 지역적으로 일치하지 않는 구성 요소를만 지역적으로 적응할 수 있다. 시간이 지남에 따라 시스템을 개선하기 위해, 실렌스는 다중 해상도 지식과 검증기를 개선하여 라우팅 결정력을 향상시킨다. 우리는 이론적으로 다중 해상도 적응이 희박한 일치 가정하에 선형 비용을 발생시키며, 진화적 업데이트 규칙이 유효성 목표를 지역 최적점까지 단조적으로 향상시키는 것을 보여준다. MuLocbench와 ALFWorld에서, 실렌스는 강력한 지식 기반 베이스 라인보다 일관되게 향상되어, 버그 로컬라이제이션에서 6.31%의 Acc@1 향상과 에이전트 성공률을 45.00%에서 51.31%까지 높였다다.

AI 모델 5월 12일

메모큐(MemQ): 자가진화하는 경험기억을 위한 Q러닝 통합

자연어 처리 대규모 언어 모델(LLM) 에서 경험기억을 축적하고 검색하는 것을 허용하지만, 현재의 방법은 각 기억을 독립적으로 평가하고 있기 때문에, 기억이 미래의 기억을 생성하는 의존성 체인에 대한 계산을 고려하지 못하고 있습니다. 메모큐(MemQ)는 TD(λ)가치 추적을 사용하여 기억 Q-값에 적용하고, 기억이 생성될 때 검색된 기억을 기록하는 증명성 DAG에 대한 후방 신호를 전파합니다. 신호의 가중치는 DAG의 깊이 d에 따라 (γλ)^d로 감소하고, 시간적 거리 대신 구조적 근접성을 사용합니다. 실험 결과, 6개의 벤치마크에서 메모큐(MemQ)는 일반화 평가와 런타임 학습에서 최고의 성공률을 달성했으며, 다단계 태스크에서 가장 큰 이익을 보였습니다.

에이전트 5월 11일

유니티가 갖는 구성 요소의 특성에 기반한 세계 모델을 위한 강화 학습 방법

유니티가 갖는 구성 요소의 특성에 기반한 세계 모델을 위한 강화 학습 방법 모델 기반 학습에서 에이전트는 세계 모델 예측에 기반하여 트레잭토리 시뮬레이션을 통해 행동을 학습한다. 표준적인 세계 모델은 일반적으로 상태와 행동을 다음 상태로 매핑하는 정적 전이 함수를 학습한다. 그러나 훈련 데이터에서 행동과 결과가 자주 동시에 발생할 때, 모델은 이러한 상관관계를 일반적인 원인-결과 규칙으로 내재화 하게 되며, 행동 전제 조건을 무시한다.しかし, 상호 작용 환경에서는 에이전트의 행동이 미래의 용이성

에이전트 5월 11일

대규모 언어 모델 기반 에이전트 시스템의 보안 감사 가능성 향상

대규모 언어 모델(LLM) 기반 에이전트 시스템은 동적 도구 호출, 상태ful 메모리 관리, 다중 에이전트 협력 등을 통해 복잡한 자율적인 작업을 수행하고 있습니다. 그러나 이 의미 기반 실행 패러다임은 저수준 물리적 이벤트와 고수준 실행 의도 사이에 심각한 의미론적 격차를 초래하여 후속 보안 감사가 근본적으로 어렵게 만듭니다. 기존의 표현 메커니즘, 정적 SBOM 및 런타임 로그 등은 단편적인 증거만 제공하고 인지 상태 진화, 기능 결합, 지속적인 메모리 오염, 상호 작용하는 에이전트 간의 연쇄적 위험 전파를 포착하지 못합니다. 이 격차를 줄이기 위해 우리는 에이전트 보안 감사에 대한 일관된 구조적 표현인 에이전트 BOM을 제안합니다. 에이전트 BOM은 에이전트 시스템을 정적 기능 기반이나 모델, 도구 및 장기 메모리와 동적 런타임 의미론적 상태인 목표, 추론 경로 및 행동을 분리하는 계층적 특성 지시 그래프로 모델링합니다. 이러한 계층은 의미적 엣지와 보안 특성으로 연결되어 실행 추적을 감사 경로로 변환합니다. 에이전트 BOM을 기반으로 우리는 경로 수준 위험 평가에 대한 그래프 쿼리 기반 패러다임을 개발하고 OWASP 에이전트 탑 10에 대한 인스턴스를 구현했습니다. 또한 OpenClaw 환경에서 라이브 실행을 통해 에이전트 BOM을 구성하는 감사 플러그인을 구현했습니다. 대표적인 실제-world 에이전트 공격 시나리오에 대한 평가 결과에 따르면 에이전트 BOM은 가려진 공격 사슬을 재구성할 수 있으며, 이는 대규모 언어 모델(LLM) 기반 에이전트 시스템의 보안 감사 가능성을 향상시킵니다.

에이전트 5월 11일

비판이 AI-assisted 이론 물리학을 개선할 때 언제? SCALAR: 구조화된 비판자-행동자 루프를 위한 의사결정적 사고

AI 지원 이론 물리학을 개선할 때 비판이 언제 작용할까? SCALAR: 구조화된 비판자-행동자 루프를 위한 의사결정적 사고 대규모 언어 모델(LLM)이 연구 수준 물리학적 사고 과제에서 점점 더 많은 가능성을 나타내고, 행동적 AI가 더 흔해지면서 실질적인 질문이 생긴다. 연구자와 에이전트 간의 상호작용이 결과에 어떤 영향을 미치는지 알아보자. 이를 위해 SCALAR(Structured Critic--Actor Loop for AI Reasoning)라는 Actor--Critic--Judge

AI 모델 5월 11일

웹리카: 시각 웹 에이전트를 위한 대규모 및 재현 가능한 훈련 환경

웹이 복잡하고 열람되지 않은 상태로 항상 변해가며, 시각 웹 에이전트를 위한 훈련 데이터를 확장하는 것은 어려운 과제입니다.目前의 데이터 수집 시도는 주로 오프라인 트래제로의 초점을 맞추거나 RL 훈련을 위한 몇몇 시뮬레이션 환경을 사용하여, 웹의 다양성을 포착하지 못하고 있습니다. 이 문제를 해결하기 위해, 우리는 웹리카(웹 복제)라는 프레임워크를 제안합니다. 이 프레임워크는 1) HTTP 레벨 캐싱을 사용하여 안정적인 시각 상태를 캡처하고 재생하며, 상호 작용을 유지하고 2) LLM 기반 환경 합성기를 사용하여 실제 웹 사이트와 웹 내비게이션의 핵심 기술을 기반으로 합니다. 이 프레임워크를 사용하여, 우리는 RL 훈련을 수천 개의 다양한 환경과 태스크에 확장합니다. 우리의 최상의 모델, 웹리카-8B는 여러 웹 내비게이션 벤치마크에서 열린 가중치 기준과 같은 크기의 모델을 능가하며, 추가 테스트 시간 컴퓨팅에 유리하며, API 모델과 경쟁할 수 있습니다.

에이전트 5월 11일

LLM 에이전트 메모리 메커니즘의 진화: 저장에서 경험까지

대규모 언어 모델(LLM)-기반 에이전트는 외부 도구와 계획 기능을 통합하여 인공지능을 완전히 새롭게 만들었습니다. 메모리 메커니즘은 이러한 시스템의 아키텍처의 temel stone로 emerged했지만, 현재 연구는 운영 체제 엔지니어링과认知과학 사이의 이론적 분열로 fragmented되어 있습니다. 이 이론적 분열은 기술 합성의 unified view와 진화의 coherent perspective를 제공하지 못합니다. 이 survey는 LLM 에이전트 메모리 메커니즘의 진화에 대한 novel framework를 제안하고, 개발 과정의 세 가지 단계를 formalize합니다: 저장(trajectory preservation), 반영(trajectory refinement), 경험(trajectory abstraction).

AI 모델 5월 11일

캐스케이드: 배포 중에 대규모 언어 모델의 지속적 적응

대규모 언어 모델(LLM)의 생명주기는 훈련과 배포 사이의 단단한 구분으로 제한되어 오랫동안 학습이 중단되었습니다. 하지만 자연인간은 환경과 상호작용하면서 지속적으로 적응합니다. 이 연구에서는 배포 중 학습(DTL)을 LLM 생명주기의 세 번째 단계로 정의하고, 배포 중에 경험을 통해 모델을 개선할 수 있는 framework인 캐스케이드(CASCADE)를 제시합니다. 캐스케이드는 LLM 에이전트를 위한 명시적이고 진화하는 에피소드 메모리를 제공하고, 경험 재사용을 문맥적 밴드릿 문제로 형식화하여, 장기 상호작용에서 노르그레트 보장을 제공합니다.

에이전트 5월 11일

회귀적 사고 시스템의 상태 표현 및 종료 조건

회귀적 사고 시스템은 새로운 증거를 획득하고 축적된 이해를 개선하는 것을 반복합니다. 이 논문은 이러한 시스템의 설계에 대한 두 가지 암시적 선택을 다룹니다: 사고 상태를 표현하는 방법과 반복을 멈추는 시점. 논문에서는 추출된 주장, 증거적 관계, 열린 질문, 신뢰도 가중치를 포함하는 지식 상태 그래프를 사용하여 사고 상태를 표현합니다. 또한 확장-Consolidate와 Consolidate-Expand의 상태 간 거리를 정의하고, 이 거리를 사용하여 반복이 더 이상 도움이 되지 않을 때를 결정합니다. 논문에서는 이러한 프레임워크를 회귀적 사고 시스템, 에이전트 루프, 트리-오브-사고 사고, 정리 증명, 지속적인 학습에 적용하는 것을 보여줍니다.

LLM PC 5월 11일

그래프DC: 분할-정복 멀티 에이전트 시스템을 이용한 대규모 그래프 알고리즘 사고

대규모 언어 모델(LLM)들은 많은 수학적 문제에서 강력한 잠재력을 보여주었지만, 그래프 알고리즘적 작업에서 여전히 불만족스러운 성능을 보이고 있다. 그래프의 자연스러운 복잡성은 더 큰 그래프에서 체계적인 다단계 사고를 필요로 하기 때문이다. 이 단점을 보완하기 위해, 우리는 그래프DC라는 분할-정복 멀티 에이전트 프레임워크를 제안한다. 이 프레임워크는 입력 그래프를 작은 서브그래프로 분할하고, 각 서브그래프를 지역적인 사고를 위한 특화된 에이전트에 할당하고, 마스터 에이전트를 이용하여 지역적인 출력과 서브그래프 간 정보를 통합하여 최종적인 해결책을 얻는다. 이 계층적 설계는 개별 에이전트의 사고 부담을 줄이고, 컴퓨팅 부하를 완화하고, 대규모 그래프 인스턴스에서 더 강한 내구성을 제공한다. 실험 결과, 그래프DC는 다양한 작업과 규모에서 그래프 알고리즘 사고에 있어 기존 방법보다 지속적으로 우수한 성능을 보인다.

인기 태그