본문으로 건너뛰기

#AI 에이전트

956개의 기사

에이전트 7월 16일

AI를 통한 사이버-물리적 간격을 연결하는 SPINE

대규모 언어 모델(LLM)로 구축된 로봇에게는 복잡한 결정을 내리기 위한 세련된 뇌를 제공했지만, 그 지능력을 물리적 플랫폼에 배포하는 것은 여전히 전문가 지식이 필요한 번거로운 조정을 필요로 합니다. 이 배포 격차, 로봇의 척추 신경,는 대규모 인공지능(AI) 물체를 위한 스케일러블한 구현을 위한 주요한 단점입니다. 따라서, 우리는 SPINE(Scalable Physical Integrat

에이전트 7월 16일

인간과 같은 역할을 하는 AI: 기업 AI 조직은 배포 문제가 아니라 플랫폼 문제라는 오해를 하고 대부분의 기업이 챗봇을 agent로 부르는 문제가 있다.

기업은 대규모 언어 모델(LLM) 제공 플랫폼에 agent 오케스트레이션을 집중시키고 있다. Anthropic의 Claude가 가장 많은 시장 점유율을 차지하고 있으며, Microsoft, OpenAI, Google, Amazon은 그 뒤를 따른다. 기업들은 오케스트레이션을 위해 모델의 중력(model gravity)을 고려하고, 멀티 스텝 실행의 신뢰성을 중요하게 여긴다. 그러나 실제로 D

에이전트 7월 15일

지리공간 기반 모델의 새로운 패러다임: 전 훈련부터 행위적 사고까지

위성 및 항공 사진 분석은 기초 모델의 등장으로 새로운 시대에 들어섰다. 이 논문은 지리 공간 기초 모델(GeoFMs)의 개념을 설명하는데, 이는 다양한 방법론을 통해 대규모 지리 공간 데이터에 대해 미리 학습된 인공 지능/기계 학습(AI/ML) 모델을 말한다. 먼저, GeoFMs가 가능하게 하는 핵심 전환을 설명하는데, 이는 대규모 모델 제공자들이 계산적으로 고가용성인 미리 학습을 수행하면

AI 모델 7월 15일

대화형 에이전트의 다차원 평가를 위한 운영화: 선택적 재평가 및 모델 벤치마크를 포함한 규제된 확장 가능한 pipe라인

retail 대화 요원 평가를 위해 단순한 단어 일치 지표 외에 의도 일치, 사실성, 도움, 명확성, ton, 및 전체 응답 품질을 평가하는 방법이 필요합니다. LLM-as-a-judge 방법은 인간 평가에 대한 대규모 대안을 제공하지만, 생산 배포는 통치, 재현성, 비용, 스키마 일관성, 추적성, 및 신뢰성과 같은 문제를 제기합니다. 우리는 GenAI Evaluation, 대규모 retia

에이전트 7월 15일

그래프 Feedback Controls Consensus와 Clique Formation을 위한 Open-Weight Language-Model Populations

대규모 언어 모델(LLM) 인구에 대한 연구에서, 연구팀은 이름 게임 프로토콜을 통해 convention formation을 연구했다. 연구 결과, restricted first-token scores를 사용하여 prompt-conditioned score-state distributions를 측정하고 state-similarity graphs를 구성할 수 있었다. 또한, sampled-label agreement와 latent state-space consensus를 분리할 수 있었다.

에이전트 7월 15일

AI 에이전트를 위한 웹 사이트 디자인: 기계적 읽기 가능성, 실행 가능성, 결정을 신뢰할 수 있는 프레임워크

온라인 쇼핑은 점점 더 AI 에이전트가 독립적으로 제품을 검색, 비교, 제약을 평가, 구매 프로세스의 일부를 수행하는 모델로 변하고 있습니다. 웹 사이트 디자인은 이제 인간과 에이전트 매개 상호 작용을 모두 지원해야 합니다. 이 연구에서는 기계적 읽기 가능성, 해석 가능성, 검증 가능성, 실행 가능성을 위한 에이전트 준비된 웹 사이트의 디자인 프레임워크를 소개합니다. 기존 웹 디자인, SEO, 생성 엔진 최적화(GEO) 지표는 웹 사이트의 에이전트 매개 상호 작용 용량을 완전히 평가하지 못했습니다.

에이전트 7월 15일

자연스러운 한국어 번역: 독립적인 기업 언어 모델의 Ontology-Amplified Distillation 및 Contextuality Auditing: 기계 메커니즘의 결합된 증명 및 부정 결과 연구

금융 규제 기관들이 데이터 거주지 규칙을 따라 운영할 때, 기관의 경계 내에서 작동할 수 있는 Tenant-owned 언어 모델이 필요하다. 이 논문은 두 개의 관련 FAOS 연구를 하나의 기계 및 제어 문서로 합병한다. 첫 번째로, 논문은 ontology-amplified distillation의 proof-of-mechanism 연구 결과를 보고한다. Foundation AgenticOS

에이전트 7월 15일

비정상성을 고려한 인컨텍스트 강화학습: 개요

ICRL(인-컨텍스트 강화 학습)에서 모델의 학습 과정에 대한 연구가 재개되면서, 미리 학습된 모델이나 미리 튜닝된 결정 모델이 상호작용 콘텍스트에서 잠재적인 작업 규칙을 추론하고 향후 행동을 개선할 수 있는 능력을 연구하고 있습니다. 이 연구는 시도-오류 증거, 보상, 전이, демон스트레이션, 피드백, 또는 취득한 경험이 콘텍스트 창구 내에서 학습과 유사한 계산을 발생시키는지 여부를 물

에이전트 7월 14일

다이나믹 트래픽 인터랙션 예측 프레임워크: 다중 상호 작용 차량의 장면 수준 경로 변경 의도와 추진 예측

자동 주행 시스템과 자율 주행 차량의 안전한 동작 계획을 위해, 주변 교통 장면이 어떻게 진화할지 정확하게 이해하는 것이 필요합니다. 그러나 대부분의 경로 변경 예측 방법은 단일 대상 차량에 집중되어 있으며, 다중 에이전트 예측 접근법은 차량의 미래 위치만을 통해 장면 진화에 대한 정보를 제한적으로 제공합니다. 이 연구에서는 다중 상호 작용 차량의 장면 수준 경로 변경 의도와 추진 예측을 위한 다이나믹 장면 그래프 주의 프레임워크를 제안합니다.

에이전트 7월 14일

연속 시간 내 피드백 연결 메모리 시스템

연속 시간 내 피드백 연결 메모리 시스템(FCMS) 아키텍처는 네 개의 추상 연산자를 통해 폐쇄 루프 조정성을 formalize합니다. 이 중 agent update 연산자 $f_i$와 환경 업데이트 연산자 $\Psi$는 원래 프레임워크에서 axiomatically 정의되지 않습니다. 이를 해결하기 위해 $f_i$는 Mechanism-Based Intelligence (MBI)에서 정의되어 agent가 지역적으로 decentralized price mechanism과 경제 원칙을 통해 업데이트되고, $\Psi$는 Coupled Memory Graph Process (CMGP)에서 정의되어 environment가 physical substrate로 취급되고 trajectory history가 기록되고 응답되는 non-Markovian framework입니다. 이로 인해 얻은 연속 시간 FCMS 인스턴스는 computable threshold $4\beta^2 < 2\eta\mu\gamma^2$로 goverened되는 Lyapunov global dissipativity를 달성합니다. 이는 discrete FCMS stability condition $4\eta\beta^2 < \gamma$와 CMGP의 physical bifurcation threshold $\alpha_c = 1/K$를 일반화합니다. 이는 memory dissipation이 feedback gain보다 빠르게 발생해야 하는 universal organizing principle임을 확인합니다. $N=2$ agent의 numerical simulation과 $N=10^6$의 mean-field validation은 stability threshold와 self-reinforcing coordination cascade가 발생하는지 여부를 확인합니다.

에이전트 7월 14일

규칙에 맞춘 작은 언어 모델과 다중 에이전트 자가 수정을 이용한 클로즈드 루프 제어

자율 산업 운영을 위한 핵심 단계 중 하나는 자연어 요구 사항 명세서에서 제어 정책을 생성하고 재구성할 수 있는 능력입니다. 이 설정에서, AI agent가 제어 정책을 생성할 수 있는 가능성이 있으며, 이에 대응하는 plant-aware validator (예: 디지털 쌍둥이)가 생성된候補 액션을 실행하기 전에 검사할 수 있다면 신뢰할 수 있는 경로가 될 수 있습니다. 그러나 실제 배포는

에이전트 7월 14일

자연어 상황에서부터 강건하고 검증 가능한 결정을 위한 YUKTI: 불확실성 유형의 제안 IR, 가정 강건한 파레토 경계, 그리고 부러움 증명서

연구자들은 대규모 언어 모델(LLM)과 같은 모델들이 단일 목표에 집중하여 숫자로 된 계획을 만드는 것을 주로 사용하지만, 이러한 모델들이 실질적인 예산, 노력, 또는 임상 주의를 할당하는 결정을 위한 신뢰도는 실패 모드이다. 이는 모든 개체화된 숫자가 가정이며, 정확히 맞지 않는 경우에만 최적화된 계획이 약한 것이기 때문이다. YUKTI는 이러한 문제를 해결하기 위해 자동 형식화의 목표를

에이전트 7월 14일

믿을만한 것이 아닌 교정적인 메시지: 다중 홉 에이전트 리레이에서 메시지 형식 효과는 계층에 따라 다름

대규모 언어 모델(LLM) agent가 서로 정보를 전달할 때, 메시지 형식이 중요합니까? 두 개의 문헌은 서로 다른 의견을 제시한다: 형식 최적화 작업은 구조화된 메시지가 비용을 절감하면서 정확성을 손상시키지 않다고 보고하지만, 형식 제한 작업은 구조를 강요하면 생성을 손상시키고 정확성을 떨어뜨린다고 보고한다. 또한 한 번의 메시지가 여러 홉을 거치면 복사 신뢰도, 단일 홉 생성이 아닌 것

에이전트 7월 13일

다양한 LLM가 장착된 물리적 요소 인공지능을 위한 컴퓨팅 파워 네트워크를 통한 효율적인 디지털 트윈 협력

물리적 인공지능 분야인 지능형工장, 창고, 서비스 로봇 등에서 다종류의 대규모 언어 모델(LLM)로 구동되는 embodied agent 팀이 널리 사용되고 있습니다. 이러한 agent 팀 간 협업을 가능하게 하기 위해 네트워크 리소스가 제한된 환경에서 안정적으로 작동하는 효율적인 협력 메커니즘이 필요합니다. 그러나 existing heterogeneous LLM-agent 협력 프레임워크가

에이전트 7월 13일

장기 임상 의사 결정에 대한 의료-agent의 성능 평가

arXiv:2607.09322v1 발표 본 연구에서는 실제 병원 기록(EHR)에 기반한 장기 시야의 의료 결정-making을 위한 LongMedBench라는 새로운 benchmark를 제시합니다. 이전에 LLM 기반 의료 agent를 평가한 연구는 주로 단기 맥락에 기반한 지식 QA와 도구 사용에 중점을 두었습니다. 그러나 실제 의료 치료는 장기적으로 진행되며, 임상가들은 반복적인 방문, 테

에이전트 7월 13일

오픈 프로버: Lean 4를 사용한 의사결정적이고 상호작용적인 정리 증명

이 시스템 논문에서는 OpenProver라는 오픈 소스 시스템을 제시한다. 이 시스템은 대규모 언어 모델(LLM)로 구동되는 자동 정리 증명(automatic theorem proving, ATP)과 통합된 Lean 4 공식 검증을 지원한다. OpenProver는 최근 ATP agent 시스템인 Aletheia에서 영감을 받은 Planner-Worker-Verifier 아키텍처를 통합한다.

에이전트 7월 13일

가정할 수 있는 인공지능 과학자들 방향: LLM agent에 대한 가설 진화 프로토콜

AI를 통해 과학적 발견을 추진하는 데 중요한 역할을 하는 대규모 언어 모델(LLM) agent의 역할은 점점 더 높아지고 있다. 광범위한 지식, 유연한 추론, 도구 사용과 같은 장비를 갖춘 이들은 과학적 문제를 해결하기 위해 자율적으로 탐구하고 해결할 수 있는 잠재력을 가지고 있다. 그들은 가설을 제안하고, 그들을 검증하고, 증거에 따라 믿음의 개선을 반복적으로 수행할 수 있다. 그러나 현

인기 태그