본문으로 건너뛰기
에이전트 7월 17일

Agent 평가 차이: 기업 AI 조직은 실재 가치와 일치하는 문제가 아니라 커버리지 문제를 가지고 있으며 대부분은 생산 환경으로 배포하고 있습니다.

인간이 AI 에게 더 많은 자율성을 부여하면서, 그에 대한 자율성을 평가하는 데 대한 신뢰를 줄여가고 있다. 157 개 기업을 대상으로 한 연구에 따르면, 절반의 기업은 내부 평가를 통과한 AI agent를 고객에게 배포한 후에 실패한 적이 있다. 현재 1/5 만이 자동 평가에 대한 신뢰를 가졌고, 가장 큰 약점은 평가가 실제 세계 결과와 일치하지 않는다는 것이다. 그러나 2/3 는 자동 평

에이전트 7월 17일

AI 맥락의 격차: 기업 AI 조직은 신뢰 문제가 아니라 검색 문제가 아니고, 대부분은 문제를 해결하는 데에 여전히 집중 중이다.

사업체 101곳에서 AI agent가 사업 환경에 대한 정보를 얻는 데 사용하는 인프라가 빠르게 구축되고 있지만, 그만큼 신뢰할 수 있는지 여부는 아직 보장되지 않았다. retrieval-augmented generation이 이미 기본적인 환경 정보의 출처로 자리 잡았고, provider-native retrieval이 quiet하게 vector databases를 능가하고 있다. 그러나,

에이전트 7월 17일

Agent 보안 단절: 54%의 기업이 AI agent 사고를 이미 겪었으며 대부분의 기업이 agent가 자격 증명을 공유하도록 허용하고 있습니다.

인터넷에서 자율적인 AI agent를 사용하는 기업은 107곳에 달한다. 이 중 절반 이상은 AI agent가 시스템과 데이터에 접근할 수 있도록 허용했으며, 제어를 포함하는 제한을 뒤쳐가고 있다. 절반 이상의 기업은 이미 AI agent 보안 사고나 가깝게 접근한 사고를 경험했으며, 3분의 1만이 각 AI agent에 고유한 범위의 식별자를 제공하고 있다. 대부분의 AI agent는 동일한

에이전트 7월 16일

진화하는 agent 하네스 만들기: 가독성, 탐색성, 편집성이 좋은 하네스 제작을 위한 가이드

현대 인공지능(AI) agent의 기능은 모델의 기초 뿐만 아니라 그에 대한 조작 장치(harness)에도 의존한다. 조작 장치는 프롬프트를 생성하고 관리하며 도구를 호출하고 실행을 조정한다. 모델, API, 환경 및 요구 사항이 발전함에 따라 조작 장치는 끊임없이 수정되어야 한다. 이 수정을 하기 전에 개발자 또는 코딩 agent는 목표 동작을 implement하는 모든 코드 위치를 식별해

에이전트 7월 16일

AI 기반의 자기 주도 AI를 위한 보험 : 가격 산정, 보험심사 및 종합 자동화

인공지능(AI)이 자율적으로 작동할 수 있게 되면서 새로운 보험 문제들이 발생합니다. 자율적 인공지능 시스템은 결정을 내릴 수 있고, 도구를 호출할 수 있고, 외부 환경을 수정할 수 있고, 세 번째 서비스와 상호 작용할 수 있습니다. 이 논문은 자율적 인공지능(Agentic AI) 배포를 위한 보험 수리, 보험 가격, 계약 설계에 대한 인공지능(AI)-자연적인 수학적 framework을 개발

에이전트 7월 16일

오라클 에이전트 메모리: 장기 기상 에이전트의 기업 메모리 서브스트레이트

장기 기상 에이전트의 메모리는 시스템 문제입니다. 실제 배포에서는 임의의 대화 내에 작업 상태를 유지하고 사용자 고유의 사실과 선호도를 세션 간에 회복하고 이전 결과에서 절차적 지식을 축적해야 합니다. 이러한 요구 사항은 문서 검색을 초과합니다. 메모리 층은 반드시 상호 작용이 지속적인 상태가 되는지, 상태가 범위화되는지, 지연 제한 내에서 상태를 검색하는지, 시간에 따라 상태를 수정하거나 삭제하는지 결정해야 합니다. 이 보고서는 오라클 데이터베이스에 기반한 오라클 에이전트 메모리(Oracle Agent Memory)라는 데이터베이스-네이티브 메모리 서브스트레이트를 연구합니다. 세 가지 주제가 논의를 조직합니다: 메모리가 인식, 추출, 통합, 검색, 요약, 수정 또는 삭제를 포함하는 라이프사이클; 활성 메모리 코어와 사용자, 에이전트 및 스레드 간의 명시적인 범위 제어를 갖는 비활성 메모리 저장소 인터페이스를 분리하는 층별 아키텍처; 다운스트림 작업 정확도와 메모리-중심 측정인 증거 검색, 회상, 지연, 추정 토큰 사용을 포함하는 평가 방법론입니다. 보고서는 LongMemEval 결과를 요약하고, 오라클 에이전트 메모리를 평평한 역사 기준선에 비해 약 10.7배 적은 토큰을 사용하고, 사용 가능한 외부 기준선에 대한 결과를 비교합니다.

에이전트 7월 16일

작은 언어 모델에서 그래프 기반 도구를 이용한 분자 물성 예측 향상

SMILES 문자열에서 제로샷 분자 속성 예측을 위한 작은 언어 모델(SLMs)은 약속을 보여주었지만 구조적 눈이 없는 구조를 가지고 있다. 이는 시퀀스 표현이 중요한 그래프-토폴로지적 단서를 명시하지 못하기 때문이다. 우리는 모듈러 콘텍스트-증강된 프롬팅 프레임워크를 제안한다. 이 프레임워크는 추론 시점에 도구 사용을 가능하게 하며, 훈련된 GNN 전문가 모델은 예측 힌트와 자신감을 제공하

에이전트 7월 16일

AI를 통한 사이버-물리적 간격을 연결하는 SPINE

대규모 언어 모델(LLM)로 구축된 로봇에게는 복잡한 결정을 내리기 위한 세련된 뇌를 제공했지만, 그 지능력을 물리적 플랫폼에 배포하는 것은 여전히 전문가 지식이 필요한 번거로운 조정을 필요로 합니다. 이 배포 격차, 로봇의 척추 신경,는 대규모 인공지능(AI) 물체를 위한 스케일러블한 구현을 위한 주요한 단점입니다. 따라서, 우리는 SPINE(Scalable Physical Integrat

에이전트 7월 16일

인간과 같은 역할을 하는 AI: 기업 AI 조직은 배포 문제가 아니라 플랫폼 문제라는 오해를 하고 대부분의 기업이 챗봇을 agent로 부르는 문제가 있다.

기업은 대규모 언어 모델(LLM) 제공 플랫폼에 agent 오케스트레이션을 집중시키고 있다. Anthropic의 Claude가 가장 많은 시장 점유율을 차지하고 있으며, Microsoft, OpenAI, Google, Amazon은 그 뒤를 따른다. 기업들은 오케스트레이션을 위해 모델의 중력(model gravity)을 고려하고, 멀티 스텝 실행의 신뢰성을 중요하게 여긴다. 그러나 실제로 D

에이전트 7월 15일

지리공간 기반 모델의 새로운 패러다임: 전 훈련부터 행위적 사고까지

위성 및 항공 사진 분석은 기초 모델의 등장으로 새로운 시대에 들어섰다. 이 논문은 지리 공간 기초 모델(GeoFMs)의 개념을 설명하는데, 이는 다양한 방법론을 통해 대규모 지리 공간 데이터에 대해 미리 학습된 인공 지능/기계 학습(AI/ML) 모델을 말한다. 먼저, GeoFMs가 가능하게 하는 핵심 전환을 설명하는데, 이는 대규모 모델 제공자들이 계산적으로 고가용성인 미리 학습을 수행하면

에이전트 7월 15일

그래프 Feedback Controls Consensus와 Clique Formation을 위한 Open-Weight Language-Model Populations

대규모 언어 모델(LLM) 인구에 대한 연구에서, 연구팀은 이름 게임 프로토콜을 통해 convention formation을 연구했다. 연구 결과, restricted first-token scores를 사용하여 prompt-conditioned score-state distributions를 측정하고 state-similarity graphs를 구성할 수 있었다. 또한, sampled-label agreement와 latent state-space consensus를 분리할 수 있었다.

에이전트 7월 15일

AI 에이전트를 위한 웹 사이트 디자인: 기계적 읽기 가능성, 실행 가능성, 결정을 신뢰할 수 있는 프레임워크

온라인 쇼핑은 점점 더 AI 에이전트가 독립적으로 제품을 검색, 비교, 제약을 평가, 구매 프로세스의 일부를 수행하는 모델로 변하고 있습니다. 웹 사이트 디자인은 이제 인간과 에이전트 매개 상호 작용을 모두 지원해야 합니다. 이 연구에서는 기계적 읽기 가능성, 해석 가능성, 검증 가능성, 실행 가능성을 위한 에이전트 준비된 웹 사이트의 디자인 프레임워크를 소개합니다. 기존 웹 디자인, SEO, 생성 엔진 최적화(GEO) 지표는 웹 사이트의 에이전트 매개 상호 작용 용량을 완전히 평가하지 못했습니다.

에이전트 7월 15일

자연스러운 한국어 번역: 독립적인 기업 언어 모델의 Ontology-Amplified Distillation 및 Contextuality Auditing: 기계 메커니즘의 결합된 증명 및 부정 결과 연구

금융 규제 기관들이 데이터 거주지 규칙을 따라 운영할 때, 기관의 경계 내에서 작동할 수 있는 Tenant-owned 언어 모델이 필요하다. 이 논문은 두 개의 관련 FAOS 연구를 하나의 기계 및 제어 문서로 합병한다. 첫 번째로, 논문은 ontology-amplified distillation의 proof-of-mechanism 연구 결과를 보고한다. Foundation AgenticOS

에이전트 7월 15일

비정상성을 고려한 인컨텍스트 강화학습: 개요

ICRL(인-컨텍스트 강화 학습)에서 모델의 학습 과정에 대한 연구가 재개되면서, 미리 학습된 모델이나 미리 튜닝된 결정 모델이 상호작용 콘텍스트에서 잠재적인 작업 규칙을 추론하고 향후 행동을 개선할 수 있는 능력을 연구하고 있습니다. 이 연구는 시도-오류 증거, 보상, 전이, демон스트레이션, 피드백, 또는 취득한 경험이 콘텍스트 창구 내에서 학습과 유사한 계산을 발생시키는지 여부를 물

에이전트 7월 14일

다이나믹 트래픽 인터랙션 예측 프레임워크: 다중 상호 작용 차량의 장면 수준 경로 변경 의도와 추진 예측

자동 주행 시스템과 자율 주행 차량의 안전한 동작 계획을 위해, 주변 교통 장면이 어떻게 진화할지 정확하게 이해하는 것이 필요합니다. 그러나 대부분의 경로 변경 예측 방법은 단일 대상 차량에 집중되어 있으며, 다중 에이전트 예측 접근법은 차량의 미래 위치만을 통해 장면 진화에 대한 정보를 제한적으로 제공합니다. 이 연구에서는 다중 상호 작용 차량의 장면 수준 경로 변경 의도와 추진 예측을 위한 다이나믹 장면 그래프 주의 프레임워크를 제안합니다.

에이전트 7월 14일

연속 시간 내 피드백 연결 메모리 시스템

연속 시간 내 피드백 연결 메모리 시스템(FCMS) 아키텍처는 네 개의 추상 연산자를 통해 폐쇄 루프 조정성을 formalize합니다. 이 중 agent update 연산자 $f_i$와 환경 업데이트 연산자 $\Psi$는 원래 프레임워크에서 axiomatically 정의되지 않습니다. 이를 해결하기 위해 $f_i$는 Mechanism-Based Intelligence (MBI)에서 정의되어 agent가 지역적으로 decentralized price mechanism과 경제 원칙을 통해 업데이트되고, $\Psi$는 Coupled Memory Graph Process (CMGP)에서 정의되어 environment가 physical substrate로 취급되고 trajectory history가 기록되고 응답되는 non-Markovian framework입니다. 이로 인해 얻은 연속 시간 FCMS 인스턴스는 computable threshold $4\beta^2 < 2\eta\mu\gamma^2$로 goverened되는 Lyapunov global dissipativity를 달성합니다. 이는 discrete FCMS stability condition $4\eta\beta^2 < \gamma$와 CMGP의 physical bifurcation threshold $\alpha_c = 1/K$를 일반화합니다. 이는 memory dissipation이 feedback gain보다 빠르게 발생해야 하는 universal organizing principle임을 확인합니다. $N=2$ agent의 numerical simulation과 $N=10^6$의 mean-field validation은 stability threshold와 self-reinforcing coordination cascade가 발생하는지 여부를 확인합니다.

에이전트 7월 14일

규칙에 맞춘 작은 언어 모델과 다중 에이전트 자가 수정을 이용한 클로즈드 루프 제어

자율 산업 운영을 위한 핵심 단계 중 하나는 자연어 요구 사항 명세서에서 제어 정책을 생성하고 재구성할 수 있는 능력입니다. 이 설정에서, AI agent가 제어 정책을 생성할 수 있는 가능성이 있으며, 이에 대응하는 plant-aware validator (예: 디지털 쌍둥이)가 생성된候補 액션을 실행하기 전에 검사할 수 있다면 신뢰할 수 있는 경로가 될 수 있습니다. 그러나 실제 배포는

에이전트 7월 14일

자연어 상황에서부터 강건하고 검증 가능한 결정을 위한 YUKTI: 불확실성 유형의 제안 IR, 가정 강건한 파레토 경계, 그리고 부러움 증명서

연구자들은 대규모 언어 모델(LLM)과 같은 모델들이 단일 목표에 집중하여 숫자로 된 계획을 만드는 것을 주로 사용하지만, 이러한 모델들이 실질적인 예산, 노력, 또는 임상 주의를 할당하는 결정을 위한 신뢰도는 실패 모드이다. 이는 모든 개체화된 숫자가 가정이며, 정확히 맞지 않는 경우에만 최적화된 계획이 약한 것이기 때문이다. YUKTI는 이러한 문제를 해결하기 위해 자동 형식화의 목표를

에이전트 7월 14일

믿을만한 것이 아닌 교정적인 메시지: 다중 홉 에이전트 리레이에서 메시지 형식 효과는 계층에 따라 다름

대규모 언어 모델(LLM) agent가 서로 정보를 전달할 때, 메시지 형식이 중요합니까? 두 개의 문헌은 서로 다른 의견을 제시한다: 형식 최적화 작업은 구조화된 메시지가 비용을 절감하면서 정확성을 손상시키지 않다고 보고하지만, 형식 제한 작업은 구조를 강요하면 생성을 손상시키고 정확성을 떨어뜨린다고 보고한다. 또한 한 번의 메시지가 여러 홉을 거치면 복사 신뢰도, 단일 홉 생성이 아닌 것