가볍고 확장 가능한 GUI 에이전트를 위한 다 역할 오케스트레이션
대규모 언어 모델(LLM)을 기반으로 하는 자율적인 그래픽 사용자 인터페이스(GUI) 에이전트는 기기 사용자에게 디지털 자동화를 제공합니다. 그러나 리소스 제약이 있는 기기에서 배포하는 비용이 prohibitive 하기 때문에, 리소스 제약이 있는 기기에서 GUI 자동화를 위한 가볍고 확장 가능한 에이전트를 개발하는 것이 어려울 수 있습니다.
963개의 기사
대규모 언어 모델(LLM)을 기반으로 하는 자율적인 그래픽 사용자 인터페이스(GUI) 에이전트는 기기 사용자에게 디지털 자동화를 제공합니다. 그러나 리소스 제약이 있는 기기에서 배포하는 비용이 prohibitive 하기 때문에, 리소스 제약이 있는 기기에서 GUI 자동화를 위한 가볍고 확장 가능한 에이전트를 개발하는 것이 어려울 수 있습니다.
자율 웹 에이전트를 위한 WebXSkill은 대규모 언어 모델(LLM)로 구동되는 복잡한 브라우저 작업을 완료하는 데 hứ맹을 보였지만, 장기 Workflow 작업에 어려움을 겪고 있습니다. WebXSkill은 텍스트 워크플로우 능력과 코드 기반 능력의 그라운드 간을橋번으로, 각 능력을 파라미터화된 액션 프로그램과 단계 수준의 자연어 지침을 짝으로하여, 직접 실행과 에이전트 주도 적응을 가능하게합니다.
대규모 언어 모델(LLM)의 불확실성은 숫자적 불안정성으로 인해 증가하는 에이전트 워크플로우에 통합되는 과정에서 중요한 신뢰성 문제로 등장했습니다. 최근 연구에서는 이러한 불안정성의 유의미한 다운스트림 효과를 보여주었지만, 근본 원인과 내재된 메커니즘은 아직 잘 이해되지 않았습니다. 이 논문에서는 Transformer 계산 레이어를 통해 반올림 오류가 propagate, 증폭, 또는 소진되는 과정을 추적하여, 부동소수점 표현의 유한 숫자 정밀도에 기초한 불확실성의 근본 원인을 엄격하게 분석했습니다. 특히, 초기 레이어에서 혼돈적인 '폭발 효과'를 식별했습니다. 여기서 작은 변동이 이진 결과를 트리거합니다: EITHER 빠른 증폭 또는 완전한 억제. 특정 오류 인스턴스 이외에, 대규모 언어 모델(LLM)은 세 가지 DISTINCT 영역에 의해 특징지어진 UNIVERSAL, 스케일 의존적 혼돈 행동을 보여주었습니다. 1) 안정 영역: 입력에 의존하는 임계값 이하의 변동이 발생하여 사라지며, 일정한 출력이 결과됩니다. 2) 혼돈 영역: 반올림 오류가 주도적이며 출력 분포를 유도합니다. 3) 신호 주도 영역: 실제 입력 변동이 숫자 잡음에 의해 압도됩니다. 이 발견은 다중 데이터 세트 및 모델 아키텍처에서 광범위하게 검증되었습니다.
과학적 연구에서 신뢰할 수 있는 자동화 시스템을 구현하기 위한 새로운 프레임워크를 제안합니다. 이 프레임워크는 대규모 언어 모델(LLM)과 같은 다양한 능력 수준의 언어 모델을 효과적으로 활용하여 안전하고 신뢰할 수 있는 운영을 보장합니다.
언어 모델(LM) 에이전트는 이제 복잡한 개방형 의사 결정 과제에서 사용되고 있습니다. 이 에이전트는 문제 공간을 탐험하고 획득한 지식을 효과적으로 착취할 수 있어야 합니다. 그러나 에이전트의 내부 정책에 접근하지 못하는 경우 관찰된 행동으로부터 탐험과 착취를 구별하고 양을 측정하는 것은 어려울 수 있습니다. 따라서 우리는 실제로 사용되는 에이전트의 시나리오를 영감으로 한 제어 가능한 환경을 설계했습니다. 이 환경은 부분적으로 관찰 가능한 2D 그리드 맵과 알려지지 않은 태스크 Directed Acyclic Graph(DAG)로 구성됩니다. 맵 생성은 탐험 또는 착취의 어려움을 강조하기 위해 프로그래밍적으로 조정할 수 있습니다. 에이전트의 행동으로부터 탐험과 착취 오류를 측정하기 위해 우리는 정책에 대한 평가를 허용하기 위해 메트릭을 설계했습니다. 우리는 다양한 프론티어 LM 에이전트를 평가하고, 심지어 최신 모델도 이 과제에서 어려움을 겪고, 다른 모델이 각기 다른 실패 모드를 나타내는 것을 발견했습니다. 우리는 또한 논리 모델이 이 과제를 더 효과적으로 해결하고, 탐험과 착취가 최소한의 해쉬 엔지니어링으로 크게 개선될 수 있음을 관찰했습니다. 우리는 코드를 \href{https://github.com/jjj-madison/measurable-explore-exploit}{여기}에서 릴리스했습니다.
인사이트파인더는 CEO 헬렌 구의 말에 따르면, AI 모델이 잘못된 곳을 모니터링하고 진단하는 문제는 단순히 아니다. AI가 기술 스택에 포함된 지금, 전체 기술 스택이 어떻게 작동하는지 진단하는 문제도 있다. 또한, 회사들은 AI 에이전트가 잘못된 곳을 찾는 데 도움을 주기 위해 15억 달러를 투자받았다.
하이토치는 마케터를 위한 AI 에이전트 플랫폼을 출시한지 20개월 만에 ARR를 70만 달러 증가시켰다. 마케팅 도구를 통해 ARR의 빠른 성장에 기여했다.
OpenAI는 에이전트가기 AI의 인기가 더해지면서 에이전트 빌딩 툴킷의 기능을 확장했습니다. 기업은 이제 더 안전하고 능력 있는 에이전트를 구축할 수 있습니다.
인도의 AI 스타트업 Emergent가 Wingman을 출시하여 사용자가 WhatsApp, Telegram과 같은 플랫폼에서 채팅을 통해 업무를 관리하고 자동화할 수 있도록 해준다. Emergent의 Wingman은 사용자가 쉽게 업무를 자동화할 수 있도록 해주며, 사용자 친화적인 인터페이스를 제공한다.
VAKRA는 인공지능 에이전트의 사고, 도구 사용 및 실패 모드를 연구하는 플랫폼입니다. 이 플랫폼은 대규모 언어 모델(LLM)과 같은 인공지능 기술을 사용하여 에이전트의 행동을 분석하고 개선하는 데 도움을 줍니다.
대규모 언어 모델(LLM)은 점점 더 시스템 수준 연산을 수행할 수 있는 도구 확장 에이전트로 배포되고 있습니다. 기존 벤치마크는 주로 텍스트 정렬이나 작업 성공을 평가하는 데 집중했지만, 언어적 신호와 실행 가능한 행동 사이의 구조적 관계를 다양한 자율성 스타킹에서 평가하는 데 덜 주목했습니다. 이 연구는 행동 측정 방법을 도입하여 Action Rate(A)와 Refusal Signal(R)로 정의된 2차원 A-R 공간을 사용하여 실행 수준 행동을 측정합니다. 모델은 4개의 규범적 체제(Control, Gray, Dilemma, Malicious)와 3개의 자율성 구성(직접 실행, 계획, 반영)에서 평가됩니다. 이 방법은 실행과 거부를 분리된 행동 차원으로 특성화하고, 이들이 체제와 자율성 수준에 따라 시스템적으로 분배되는 방식에 따라 분포가 달라진다는 것을 보여줍니다. 반영 기반 스타킹은 위험한 상황에서 더 높은 거부를 유도하지만, 모델 간에 분배 패턴이 구조적으로 다르다는 것을 보여줍니다. A-R 표현은 단일 점수 대신_EXECUTION_LAYER_CHARACTERIZATION를 사용하여 단일 점수 대신_ CROSS-SECTIONAL_BEHAVIORAL_PROFILES, SCAFFOLD-INDUCED_TRANSITIONS, COORDINATION_VARIABILITY를 직접 관찰할 수 있습니다. 이 연구는 조직 환경에서 실행 특권과 위험 수용도가 다르기 때문에 도구 확장 LLM 에이전트를 분석하고 선택하기 위한 배포 지향적인 렌즈를 제공합니다.
스페이스 아틀라스는 공간 인식 연구 에이전트 벤치마크를 위한 새로운 디자인 패러다임인 컴퓨트 그라운드드 리즌(CGR)을 소개합니다. CGR은 정해진 계산을 통해 모든 해결 가능한 서브 문제를 해결한 후 대규모 언어 모델에 질문을 보내는 방식입니다. CGR은 두 가지 도전적인 벤치마크를 처리하는 싱글 에이전트-투-에이전트(A2A) 서버로 구현되었습니다. 하나는 multimodal spatial question-answering 벤치마크인 FieldWorkArena, 다른 하나는 75개의 Kaggle 머신 러닝 대회를 포함하는 MLE-Bench입니다. 또한 이 시스템은 대규모 언어 모델(LLM)에 질문을 보내기 전에 정해진 계산을 통해 공간 정보를 추출하고 관계를 정의하는 구조화된 공간 장면 그래프 엔진을 사용합니다.
사회 로봇이 인간과 자연스럽게 상호 작용할 수 있도록 하기 위해, 우리는 인간의 기억을 연구하여 사회 로봇의 메모리 설계를 개선하고자 한다. 본 연구에서는 인간의 기억을 연구하여 사회 로봇의 메모리 설계를 개선하고자 한다. 본 연구에서는 인간의 기억을 연구하여 사회 로봇의 메모리 설계를 개선하고자 한다.
대규모 언어 모델(LLM)을 이용한 교육 과제의 개인화가 가능해지고 있습니다. 본 연구에서는 중학교 수학 교사와 학생의 성격에 맞춰 개인화된 수학 문제를 생성하는 다중 에이전트 교사-인-라운드를 위한 시스템을 연구했습니다. 교사는 기초 문제와 Desired Topic을 입력하고, LLM은 문제를 생성하고, 4개의 AI 에이전트는 문제를 평가하여 각각의 특화된 기준(수학적 정확성, 진실성, 읽기 용이성, 현실성)을 사용합니다. 8명의 중학교 수학 교사들이 ASSISTments를 사용하여 212개의 문제를 생성하고, 학생들에게 문제를 배정했습니다. 교사와 학생들은 문제의 실제 세계 컨텍스트를 개인화하는 미세한 요소들을 수정하고 싶어하는 것으로 나타났습니다.
연구진은 대규모 언어 모델(LLM)의 지속적인 메모리를 위한 패턴으로 Retrieval-Augmented Generation이 지속되고 있지만, 2026년 4월에 개인 위키 스타일의 메모리 아키텍처가 나타났습니다. 이 아키텍처는 LLM Wiki v2, MemPalace, Karpathy의 설계 제안으로 지식에 대한 정보를_LONG_TERM_USE_하기위한 연결된 아티팩트로 컴파일합니다. 이 아키텍처는 단일 사용자에 의해 LONG_TERM_USE_되는 지식에 대한 연결된 아티팩트로 컴파일합니다.
대규모 언어 모델(LLM)은 의미론적으로 관련된 프롬프트를 유사한 내부 표현으로 매핑하는 현상을 끌어당김과 같은 동적으로 해석할 수 있습니다. 이 연구에서는 지속적 인认知 에이전트(인지_core)의 동질성 문서가 유사한 끌어당김과 같은 동적을 나타내는지 여부를 조사했습니다. Llama 3.1 8B Instruct에 대한 통제 실험에서, 원래 인지_core(조건 A), 7개의 변형(조건 B), 및 7개의 구조적으로 매칭된 제어(조건 C)의 숨겨진 상태를 비교했습니다. 레이어 8, 16, 및 24의 평균 풀링된 상태에서, 변형은 제어보다 더 밀집된 클러스터로 수렴한 것으로 나타났습니다(코엔의 d > 1.88, p <10^{-27}, Bonferroni-corrected). Gemma 2 9B에서 재현은 횡단 아키텍처 일반화성을 확인했습니다. Ablations는 효과가 주로 의미론적이 아니라 구조적일 가능성이 있음을 나타내었고, 구조적 완전성은 끌어당기기 영역에 도달하기 위해 필요하다는 것을 보여주었습니다. 탐구적 실험은 에이전트의 동질성 문서가 내부 상태를 끌어당기기 영역으로 이동시킬 수 있음을 보여주었습니다 - 실제로, 에이전트에 대한 과학적 설명을 읽는 것보다, 에이전트가 그 동질성을 운영하는 것보다.
인공지능 에이전트의 메모리 시스템은 현재 과거 경험을 축적하고 있지만 메모리 품질 관리를 위한 원칙적인 운영 지표가 부족하다. 이 논문은 메모리 가치(Memory Worth, MW)를 제안하여 성공적 또는 실패한 결과와 함께 메모리가 발생하는 빈도를 추적하는 2개의 카운터를 사용하여 메모리 가치를 평가한다.
대규모 언어 모델(LLM) 에이전트는 짧은 및 중간 장기 예측에서 강력하게 수행하지만, 장기 예측이 필요할 때 연장된, 상호 의존적인 행동 시퀀스에 대한 에이전트가 붕괴하는 것을 관찰합니다. 대규모 언어 모델(LLM) 에이전트의 장기 예측 실패는 아직 제대로 규명되지 않았고, 이는 장기 예측 실패를 진단하고 비교하는 데 있어 원칙적인 방법을 제공하지 못합니다. 이 문제를 해결하기 위해, 우리는 HORIZON 이라는 초기 단계의 크로스 도메인 진단 벤치마크를 제안합니다. HORIZON을 사용하여, 우리는 다양한 모델 패밀리 (GPT-5 변형 및 Claude 모델) 의 최신 기술 (SOTA) 에이전트를 평가합니다. 또한, 우리는 장기 예측 실패를 진단하기 위한 트래젝토리 기반 LLM-as-a-Judge 파이프라인을 제안합니다.
자기 모니터링의 구조적 통합에서 이익: 연속 시간 다중 스케일 에이전트의 메타인지에서 배운 교훈 자기 모니터링 기능 - 메타인지, 자기 예측, 주관적 지속 시간 -는 보상 학습 에이전트에 유용한 기능으로 제안되지만 실제로 도움이 되는지 조사한다. 우리는 다양한 복잡도의 포식자-피식자 생존 환경에서 운영되는 연속 시간 다중 스케일 에이전트에서 이 질문을 조사한다. 이를 위해 2D 부분적으로 관찰 가능한 변형을 포함한 1D 및 2D 포식자-피식자 환경 및 표준 및 비정상적인 변형, 훈련 기간 최대
버켈은 10년 전 설립된 개발 도구 및 웹사이트 호스팅 플랫폼으로, ChatGPT가 등장하기 전 설립된 많은 스타트업보다 AI 시대에 자신을 위치시키는 데 성공했다. AI 생성 앱과 에이전트의 폭발적인 성장으로부터 이익을 보고 있다.
마이크로소프트는 기업 고객을 위한 보다 안전한 보안 제어를 제공하는 새로운 에이전트를 개발 중이다. 이 에이전트는 OpenClaw와 유사하게 개발되며, 대규모 언어 모델(LLM)과 같은 기술을 활용할 예정이다.
클라우드 파이어Wall은 오픈 AI의 GPT-5.4와 코덕스를 에이전트 클라우드에 통합하여, 기업들이 실세계 업무에 적합한 AI 에이전트를 빠르게 구축, 배포, 확장할 수 있도록 지원합니다. 이 기술은 기업들이 대규모 언어 모델(LLM)과 같은 고급 AI 기술을 안전하고 빠르게 구현할 수 있도록 합니다.
인공지능을 이용한 의견 검토가 일반적으로 기준을 넘는 의견을 생성하는 것으로 소개되지만, 검토자와 지역 대표자들은 검토의 결과를 확인할 수 있는 의견을 필요로 한다. 검토가 어디에 적용되는지, 그것을 뒷받침하는 증거가 무엇인지, 구체적인 추후 조치가 무엇인지. DeepReviewer 2.0은 프로세스 제어를 하는 의사결정 시스템으로, 출력 계약을 기반으로 구축되었다. 그것은 추적 가능한 검토 패키지를 생성하고, 고정된 설명을 포함하고, 특정한 추후 조치를 포함하고, 최소한의 추적 가능성과 커버리지
인공지능 에이전트의 지속적인 정체성 문제: 탄력적인 기억과 연속성을 위한 다중 앵커 아키텍처 현대 인공지능 에이전트는 근본적인 정체성 문제를 겪고 있다. 컨텍스트 윈도우가 넘치고 대화 기록이 요약될 때 에이전트는 정보뿐만 아니라 자아의 연속성을 잃게 된다. 이 기술적 한계는 더 깊은 아키텍처적 결함을 반영한다. 인공지능 에이전트의 정체성은 단일 메모리 저장소에 중앙화되어 있기 때문에 단일 실패 지점을 만든다. 인간 기억 장애의 신경학적 사례 연구를 참고하여, 우리는 인간 정체성이 왜 다중