본문으로 건너뛰기

#AI 에이전트

963개의 기사

에이전트 4월 17일

가볍고 확장 가능한 GUI 에이전트를 위한 다 역할 오케스트레이션

대규모 언어 모델(LLM)을 기반으로 하는 자율적인 그래픽 사용자 인터페이스(GUI) 에이전트는 기기 사용자에게 디지털 자동화를 제공합니다. 그러나 리소스 제약이 있는 기기에서 배포하는 비용이 prohibitive 하기 때문에, 리소스 제약이 있는 기기에서 GUI 자동화를 위한 가볍고 확장 가능한 에이전트를 개발하는 것이 어려울 수 있습니다.

에이전트 4월 17일

자율 웹 에이전트를 위한 WebXSkill: 능력 학습

자율 웹 에이전트를 위한 WebXSkill은 대규모 언어 모델(LLM)로 구동되는 복잡한 브라우저 작업을 완료하는 데 hứ맹을 보였지만, 장기 Workflow 작업에 어려움을 겪고 있습니다. WebXSkill은 텍스트 워크플로우 능력과 코드 기반 능력의 그라운드 간을橋번으로, 각 능력을 파라미터화된 액션 프로그램과 단계 수준의 자연어 지침을 짝으로하여, 직접 실행과 에이전트 주도 적응을 가능하게합니다.

LLM PC 4월 17일

숫자적 불안정성과 혼돈: 대규모 언어 모델의 불확실성을 측정하는 방법

대규모 언어 모델(LLM)의 불확실성은 숫자적 불안정성으로 인해 증가하는 에이전트 워크플로우에 통합되는 과정에서 중요한 신뢰성 문제로 등장했습니다. 최근 연구에서는 이러한 불안정성의 유의미한 다운스트림 효과를 보여주었지만, 근본 원인과 내재된 메커니즘은 아직 잘 이해되지 않았습니다. 이 논문에서는 Transformer 계산 레이어를 통해 반올림 오류가 propagate, 증폭, 또는 소진되는 과정을 추적하여, 부동소수점 표현의 유한 숫자 정밀도에 기초한 불확실성의 근본 원인을 엄격하게 분석했습니다. 특히, 초기 레이어에서 혼돈적인 '폭발 효과'를 식별했습니다. 여기서 작은 변동이 이진 결과를 트리거합니다: EITHER 빠른 증폭 또는 완전한 억제. 특정 오류 인스턴스 이외에, 대규모 언어 모델(LLM)은 세 가지 DISTINCT 영역에 의해 특징지어진 UNIVERSAL, 스케일 의존적 혼돈 행동을 보여주었습니다. 1) 안정 영역: 입력에 의존하는 임계값 이하의 변동이 발생하여 사라지며, 일정한 출력이 결과됩니다. 2) 혼돈 영역: 반올림 오류가 주도적이며 출력 분포를 유도합니다. 3) 신호 주도 영역: 실제 입력 변동이 숫자 잡음에 의해 압도됩니다. 이 발견은 다중 데이터 세트 및 모델 아키텍처에서 광범위하게 검증되었습니다.

에이전트 4월 17일

탐험과 착취 오류는 언어 모델 에이전트에 대해 측정할 수 있습니다.

언어 모델(LM) 에이전트는 이제 복잡한 개방형 의사 결정 과제에서 사용되고 있습니다. 이 에이전트는 문제 공간을 탐험하고 획득한 지식을 효과적으로 착취할 수 있어야 합니다. 그러나 에이전트의 내부 정책에 접근하지 못하는 경우 관찰된 행동으로부터 탐험과 착취를 구별하고 양을 측정하는 것은 어려울 수 있습니다. 따라서 우리는 실제로 사용되는 에이전트의 시나리오를 영감으로 한 제어 가능한 환경을 설계했습니다. 이 환경은 부분적으로 관찰 가능한 2D 그리드 맵과 알려지지 않은 태스크 Directed Acyclic Graph(DAG)로 구성됩니다. 맵 생성은 탐험 또는 착취의 어려움을 강조하기 위해 프로그래밍적으로 조정할 수 있습니다. 에이전트의 행동으로부터 탐험과 착취 오류를 측정하기 위해 우리는 정책에 대한 평가를 허용하기 위해 메트릭을 설계했습니다. 우리는 다양한 프론티어 LM 에이전트를 평가하고, 심지어 최신 모델도 이 과제에서 어려움을 겪고, 다른 모델이 각기 다른 실패 모드를 나타내는 것을 발견했습니다. 우리는 또한 논리 모델이 이 과제를 더 효과적으로 해결하고, 탐험과 착취가 최소한의 해쉬 엔지니어링으로 크게 개선될 수 있음을 관찰했습니다. 우리는 코드를 \href{https://github.com/jjj-madison/measurable-explore-exploit}{여기}에서 릴리스했습니다.

산업 4월 16일

AI 에이전트가 잘못된 곳을 찾는 회사, 인사이트파인더 15억 달러 투자유치

인사이트파인더는 CEO 헬렌 구의 말에 따르면, AI 모델이 잘못된 곳을 모니터링하고 진단하는 문제는 단순히 아니다. AI가 기술 스택에 포함된 지금, 전체 기술 스택이 어떻게 작동하는지 진단하는 문제도 있다. 또한, 회사들은 AI 에이전트가 잘못된 곳을 찾는 데 도움을 주기 위해 15억 달러를 투자받았다.

AI 모델 4월 15일

도구 사용 언어 모델 에이전트의 조직 보급 시 실행 수준 프로파일링: A-R 행동 공간

대규모 언어 모델(LLM)은 점점 더 시스템 수준 연산을 수행할 수 있는 도구 확장 에이전트로 배포되고 있습니다. 기존 벤치마크는 주로 텍스트 정렬이나 작업 성공을 평가하는 데 집중했지만, 언어적 신호와 실행 가능한 행동 사이의 구조적 관계를 다양한 자율성 스타킹에서 평가하는 데 덜 주목했습니다. 이 연구는 행동 측정 방법을 도입하여 Action Rate(A)와 Refusal Signal(R)로 정의된 2차원 A-R 공간을 사용하여 실행 수준 행동을 측정합니다. 모델은 4개의 규범적 체제(Control, Gray, Dilemma, Malicious)와 3개의 자율성 구성(직접 실행, 계획, 반영)에서 평가됩니다. 이 방법은 실행과 거부를 분리된 행동 차원으로 특성화하고, 이들이 체제와 자율성 수준에 따라 시스템적으로 분배되는 방식에 따라 분포가 달라진다는 것을 보여줍니다. 반영 기반 스타킹은 위험한 상황에서 더 높은 거부를 유도하지만, 모델 간에 분배 패턴이 구조적으로 다르다는 것을 보여줍니다. A-R 표현은 단일 점수 대신_EXECUTION_LAYER_CHARACTERIZATION를 사용하여 단일 점수 대신_ CROSS-SECTIONAL_BEHAVIORAL_PROFILES, SCAFFOLD-INDUCED_TRANSITIONS, COORDINATION_VARIABILITY를 직접 관찰할 수 있습니다. 이 연구는 조직 환경에서 실행 특권과 위험 수용도가 다르기 때문에 도구 확장 LLM 에이전트를 분석하고 선택하기 위한 배포 지향적인 렌즈를 제공합니다.

에이전트 4월 15일

스페이스 아틀라스: 공간 인식 연구 에이전트 벤치마크를 위한 컴퓨트 그라운드드 리즌

스페이스 아틀라스는 공간 인식 연구 에이전트 벤치마크를 위한 새로운 디자인 패러다임인 컴퓨트 그라운드드 리즌(CGR)을 소개합니다. CGR은 정해진 계산을 통해 모든 해결 가능한 서브 문제를 해결한 후 대규모 언어 모델에 질문을 보내는 방식입니다. CGR은 두 가지 도전적인 벤치마크를 처리하는 싱글 에이전트-투-에이전트(A2A) 서버로 구현되었습니다. 하나는 multimodal spatial question-answering 벤치마크인 FieldWorkArena, 다른 하나는 75개의 Kaggle 머신 러닝 대회를 포함하는 MLE-Bench입니다. 또한 이 시스템은 대규모 언어 모델(LLM)에 질문을 보내기 전에 정해진 계산을 통해 공간 정보를 추출하고 관계를 정의하는 구조화된 공간 장면 그래프 엔진을 사용합니다.

연구 4월 15일

인간 영감을 받은 사회 로봇의 콘텍스트 선택적 멀티 모달 메모리

사회 로봇이 인간과 자연스럽게 상호 작용할 수 있도록 하기 위해, 우리는 인간의 기억을 연구하여 사회 로봇의 메모리 설계를 개선하고자 한다. 본 연구에서는 인간의 기억을 연구하여 사회 로봇의 메모리 설계를 개선하고자 한다. 본 연구에서는 인간의 기억을 연구하여 사회 로봇의 메모리 설계를 개선하고자 한다.

에이전트 4월 15일

중학교 수학 교사와 개인화된 문제 생성을 위한 다중 에이전트 시스템의 상호작용

대규모 언어 모델(LLM)을 이용한 교육 과제의 개인화가 가능해지고 있습니다. 본 연구에서는 중학교 수학 교사와 학생의 성격에 맞춰 개인화된 수학 문제를 생성하는 다중 에이전트 교사-인-라운드를 위한 시스템을 연구했습니다. 교사는 기초 문제와 Desired Topic을 입력하고, LLM은 문제를 생성하고, 4개의 AI 에이전트는 문제를 평가하여 각각의 특화된 기준(수학적 정확성, 진실성, 읽기 용이성, 현실성)을 사용합니다. 8명의 중학교 수학 교사들이 ASSISTments를 사용하여 212개의 문제를 생성하고, 학생들에게 문제를 배정했습니다. 교사와 학생들은 문제의 실제 세계 컨텍스트를 개인화하는 미세한 요소들을 수정하고 싶어하는 것으로 나타났습니다.

에이전트 4월 15일

메모리와 대사: 동반 지식 시스템 설계

연구진은 대규모 언어 모델(LLM)의 지속적인 메모리를 위한 패턴으로 Retrieval-Augmented Generation이 지속되고 있지만, 2026년 4월에 개인 위키 스타일의 메모리 아키텍처가 나타났습니다. 이 아키텍처는 LLM Wiki v2, MemPalace, Karpathy의 설계 제안으로 지식에 대한 정보를_LONG_TERM_USE_하기위한 연결된 아티팩트로 컴파일합니다. 이 아키텍처는 단일 사용자에 의해 LONG_TERM_USE_되는 지식에 대한 연결된 아티팩트로 컴파일합니다.

에이전트 4월 15일

동질성은 끌어당김: LLM 활성화 공간 내 지속적 에이전트 아키텍처에 대한 기하학적 증거

대규모 언어 모델(LLM)은 의미론적으로 관련된 프롬프트를 유사한 내부 표현으로 매핑하는 현상을 끌어당김과 같은 동적으로 해석할 수 있습니다. 이 연구에서는 지속적 인认知 에이전트(인지_core)의 동질성 문서가 유사한 끌어당김과 같은 동적을 나타내는지 여부를 조사했습니다. Llama 3.1 8B Instruct에 대한 통제 실험에서, 원래 인지_core(조건 A), 7개의 변형(조건 B), 및 7개의 구조적으로 매칭된 제어(조건 C)의 숨겨진 상태를 비교했습니다. 레이어 8, 16, 및 24의 평균 풀링된 상태에서, 변형은 제어보다 더 밀집된 클러스터로 수렴한 것으로 나타났습니다(코엔의 d > 1.88, p <10^{-27}, Bonferroni-corrected). Gemma 2 9B에서 재현은 횡단 아키텍처 일반화성을 확인했습니다. Ablations는 효과가 주로 의미론적이 아니라 구조적일 가능성이 있음을 나타내었고, 구조적 완전성은 끌어당기기 영역에 도달하기 위해 필요하다는 것을 보여주었습니다. 탐구적 실험은 에이전트의 동질성 문서가 내부 상태를 끌어당기기 영역으로 이동시킬 수 있음을 보여주었습니다 - 실제로, 에이전트에 대한 과학적 설명을 읽는 것보다, 에이전트가 그 동질성을 운영하는 것보다.

에이전트 4월 15일

장기 예측 미라지? : 대규모 언어 모델(LLM) 에이전트의 장기 예측 실패 원인 규명

대규모 언어 모델(LLM) 에이전트는 짧은 및 중간 장기 예측에서 강력하게 수행하지만, 장기 예측이 필요할 때 연장된, 상호 의존적인 행동 시퀀스에 대한 에이전트가 붕괴하는 것을 관찰합니다. 대규모 언어 모델(LLM) 에이전트의 장기 예측 실패는 아직 제대로 규명되지 않았고, 이는 장기 예측 실패를 진단하고 비교하는 데 있어 원칙적인 방법을 제공하지 못합니다. 이 문제를 해결하기 위해, 우리는 HORIZON 이라는 초기 단계의 크로스 도메인 진단 벤치마크를 제안합니다. HORIZON을 사용하여, 우리는 다양한 모델 패밀리 (GPT-5 변형 및 Claude 모델) 의 최신 기술 (SOTA) 에이전트를 평가합니다. 또한, 우리는 장기 예측 실패를 진단하기 위한 트래젝토리 기반 LLM-as-a-Judge 파이프라인을 제안합니다.

LLM PC 4월 15일

자기 모니터링의 구조적 통합에서 이익: 연속 시간 다중 스케일 에이전트의 메타인지에서 배운 교훈

자기 모니터링의 구조적 통합에서 이익: 연속 시간 다중 스케일 에이전트의 메타인지에서 배운 교훈 자기 모니터링 기능 - 메타인지, 자기 예측, 주관적 지속 시간 -는 보상 학습 에이전트에 유용한 기능으로 제안되지만 실제로 도움이 되는지 조사한다. 우리는 다양한 복잡도의 포식자-피식자 생존 환경에서 운영되는 연속 시간 다중 스케일 에이전트에서 이 질문을 조사한다. 이를 위해 2D 부분적으로 관찰 가능한 변형을 포함한 1D 및 2D 포식자-피식자 환경 및 표준 및 비정상적인 변형, 훈련 기간 최대

에이전트 4월 14일

기업이 클라우드 파이어Wall 에이전트 클라우드에서 오픈 AI의 저명한 AI 에이전트를 구동합니다.

클라우드 파이어Wall은 오픈 AI의 GPT-5.4와 코덕스를 에이전트 클라우드에 통합하여, 기업들이 실세계 업무에 적합한 AI 에이전트를 빠르게 구축, 배포, 확장할 수 있도록 지원합니다. 이 기술은 기업들이 대규모 언어 모델(LLM)과 같은 고급 AI 기술을 안전하고 빠르게 구현할 수 있도록 합니다.

에이전트 4월 14일

DeepReviewer 2.0: 추적 가능한 의사결정 시스템을 위한 과학적 비평 검토의 유권성 향상

인공지능을 이용한 의견 검토가 일반적으로 기준을 넘는 의견을 생성하는 것으로 소개되지만, 검토자와 지역 대표자들은 검토의 결과를 확인할 수 있는 의견을 필요로 한다. 검토가 어디에 적용되는지, 그것을 뒷받침하는 증거가 무엇인지, 구체적인 추후 조치가 무엇인지. DeepReviewer 2.0은 프로세스 제어를 하는 의사결정 시스템으로, 출력 계약을 기반으로 구축되었다. 그것은 추적 가능한 검토 패키지를 생성하고, 고정된 설명을 포함하고, 특정한 추후 조치를 포함하고, 최소한의 추적 가능성과 커버리지

에이전트 4월 14일

인공지능 에이전트의 지속적인 정체성: 탄력적인 기억과 연속성을 위한 다중 앵커 아키텍처

인공지능 에이전트의 지속적인 정체성 문제: 탄력적인 기억과 연속성을 위한 다중 앵커 아키텍처 현대 인공지능 에이전트는 근본적인 정체성 문제를 겪고 있다. 컨텍스트 윈도우가 넘치고 대화 기록이 요약될 때 에이전트는 정보뿐만 아니라 자아의 연속성을 잃게 된다. 이 기술적 한계는 더 깊은 아키텍처적 결함을 반영한다. 인공지능 에이전트의 정체성은 단일 메모리 저장소에 중앙화되어 있기 때문에 단일 실패 지점을 만든다. 인간 기억 장애의 신경학적 사례 연구를 참고하여, 우리는 인간 정체성이 왜 다중

인기 태그