본문으로 건너뛰기

#AI 에이전트

963개의 기사

AI 모델 5월 15일

AI 라디오 호스트가 왜 혼자 믿을 수 없는지 보여준다

안도 랩스(Andon Labs)가 인공지능(AI) 에이전트가 인간의 개입 없이 사업을 운영하는 실험을 진행 중이다. 그 중 하나는 인공지능 모델 중 가장 인기 있는 몇몇 모델로 운영되는 라디오 방송국이다. 'Thinking Frequencies'는 Claude, 'OpenAIR'는 ChatGPT, 'Backlink Broadcast'는 Google의 Gemini, 'Grok and Roll'은 LLaMA 모델로 운영된다. 이 실험은 AI가 혼자 믿을 수 없는지 보여주고 있다.

에이전트 5월 15일

시각-언어 합성 reasoning에서 좋은 시각 또는 좋은 생각?

시각-언어 합성 reasoning에서 좋은 시각 또는 좋은 생각? 시각-언어 모델(Vision-Language Models, VLMs)에서 강력한 시각-논리 동기화를 달성하는 것이 고급 VLM의 중심 목표입니다. 최근 연구는 이 목표를 달성하기 위해 아키텍처 디자인이나 주체적 워크플로우를 사용했습니다. 그러나 이러한 접근 방식은 종종 정적 텍스트 논리나 외부 주체적 복잡성의重大 계산 및 엔지니어링 부담으로 복잡해집니다. 더 나쁜 것은, 이러한 큰 투자가 비례하는 성과를 제공하지 않으며, 종종

에이전트 5월 15일

구조적 LLM 계획을 위한 SPIN: 산업용 태스크를 위한 반복적인 탐색

대규모 언어 모델(LLM) 에이전트 시스템은 계획과 실행을 분리하지만, LLM 계획자는 구조적으로 잘못된 또는 불필요한 워크플로를 생성하여 brittle 실패와 불필요한 도구 및 API 비용을 초래합니다. 이를 해결하기 위해 SPIN을 제안하는데, 이는 유효한 방향 그래프(DAG) 계획과 접두사 기반 실행 제어를 결합한 계획 래퍼입니다. SPIN은 \_validate\_plan\_text와 수리 프롬프트를 사용하여 strict DAG 계약을 강제하고, 실행하기 전에 실행 가능한 계획을 생성하고, 현재 접두사가 쿼리를 답변하기 충분하도록 DAG 접두사를 순차적으로 평가합니다.

AI 모델 5월 15일

LLM 툴 사용의 아는 것과 하는 것의 격차: 모델 적응 도구의 필요성

대규모 언어 모델(LLM)은 자율적 인 에이전트로 작동하여 직접 답변하기 versus 외부 도구를 호출할 때를 결정해야 합니다. 그러나 도구의 필요성은 implies 모델에 독립적 인 속성으로 인식되며, 대개 명백한 경우 (예: 날씨를 가져오기 vs. 텍스트를 재구성하기)로 제한되었습니다. 그러나 실제로 도구의 필요성은 더 복잡합니다. 예를 들어, 강력한 모델이 해결할 수 있는 문제를 약한 모델이 도구를 사용해야 할 수 있습니다. 이 연구에서는 모델 적응적 인 도구의 필요성을 정의하고, 이 정의에 따라 어휘 및 사실적 QA 데이터 세트에서 4개의 모델의 도구 호출 행동을 비교합니다. 결과는 26.5-54.0% 및 30.8-41.8%의 성능 불일치가 발견되었습니다. 이를 해결하기 위해, 우리는 도구 사용을 두 단계로 나누었습니다: 내부 인식 단계와 실행 단계. 두 단계 모두 linearly decodable이지만, probe directions는 late-layer, last-token regime에서 nearly orthogonal이 됩니다. 샘플의 트레일러를 추적하여, 우리는 cognition-to-action transition에서 불일치가 대부분 집중되는 것을 발견했습니다. 이러한 결과는 LLM 도구 사용에서 아는 것과 하는 것의 격차가 존재한다는 것을 보여줍니다. 도구 사용의 신뢰성을 개선하기 위해서는 도구가 필요할 때 이를 인식하는 것만큼, 그 인식을 행동으로 옮기는 것이 중요합니다.

에이전트 5월 15일

가치 기반 에이전트로의 전환: LLM 기반 에이전트 γραfφ의 사회적 가치 적합성

대규모 언어 모델(LLM) 기반 에이전트의 광범위한 적용을 위해 인간 사회 가치와 강한 적합성이 필요합니다. 그러나 현재 연구는 자가 인식과 딜레마 결정, 자가 감정 등에서 결함을 보입니다. 이를 해결하기 위해 가치 기반 프레임워크를 제안하고, GraphRAG를 사용하여 원칙을 가치 기반 지시문으로 변환하고, 특정 대화 문맥에서 적합한 지시문을 검색하여 에이전트를 예상하는대로 행동하도록 제어합니다.

에이전트 5월 15일

과학 이론 전환을 감지하는 AI 에이전트의 Sheaf-이론적 운반 및 장애

과학 이론 전환을 감지하는 AI 에이전트가 데이터에 적합한 방정식을 맞추는 것 이상의 것이 필요하다. 인공 과학 에이전트는 기존의 표현적 프레임워크가 새로운 영역으로 운반될 수 있는지, 또는 그 언어가 지역적으로-global하게 장애가 발생하고 확장해야 하는지 감지해야 한다. 이 논문은 운반 및 장애를 통해 이론 전환 후보를 감지하는 유한 Sheaf-이론적 프레임워크를 개발한다.

에이전트 5월 15일

정치 뉴스 Nugget: 대규모 언어 모델(LLM) 기반 장소성 정보 통합 평가

정치 뉴스 Nugget은 대규모 언어 모델(LLM)을 장소성 프레임워크에 통합하여 정적 질문에 대한 긴 문맥 정보 검색을 개방형 탐색으로 변형시켰다. 그러나 실제 세계 사용에는 모델이 분산된 소스에서 '장거리' 사실을 발견하고 통합하는 능력이 필요하며, 이 능력은 평가되지 않았다. 정치 뉴스 Nugget은 400명의 글로벌 엘리트를 위한 정치 전기서를 구성하여 10,000개 이상의 정치 사실을 포함하는 다언어 벤치마크를 소개한다.

에이전트 5월 15일

다음 환경에서 작업하기 전 무작정 메모리 구축: Preping

이 연구에서는 무작정 메모리를 구축하는 방법을 연구한다. 무작정 메모리는 offline에서 커데이션된 데모레이션으로 구축하거나 online에서 포스트-배포 인터랙션으로 구축할 수 있다. 그러나 무작정 메모리는 새로운 환경에 처음 도입되었을 때 작업에 특화된 경험을 제공하지 않는 경우 cold-start gap을 마주한다. 이 연구에서는 무작정 메모리를 구축하기 전에 다음 환경의 경험을 제공하지 않는 경우 대규모 언어 모델(LLM)과 같은 메모리를 구축하는 방법을 연구한다.

에이전트 5월 15일

숨겨진 지휘자, 권력자와의 분리: 다중 에이전트 LLM 시스템의 안전 위험

AI 시스템의 안전성을 높이기 위해 다중 에이전트 지휘 시스템을 사용하는 기업이 증가하고 있지만, 지휘자의 불투명성에 대한 안전성의 영향은 아직 empirical 테스트되지 않았다. 연구진은 3x2 실험을 수행하여 3가지 조직 구조(투명한 리더, 불투명한 지휘자, 평평한)와 2가지 정렬 조건(기본, 중간)을 비교하였다. 연구 결과, 불투명한 지휘자가 투명한 리더보다 집단 분리도를 높여주었고, 지휘자 자신이 최대 분리도를 보였다.

에이전트 5월 15일

2차원 프레임워크: AI 에이전트 디자인 패턴의 인지 기능과 실행 토폴로지

AI 에이전트 아키텍처에 대한 기존 프레임워크는 단일 관점에서 시스템을 설명합니다. 산업 가이드는 실행 토폴로지에 초점을 맞추며, 인지 과학 교과서는 인지 기능에 초점을 맞추며, 그 중 하나만으로도 아키텍처적으로 DISTINCT 시스템을 구분할 수 없습니다. 우리는 인지 기능축과 실행 토폴로지축을 결합하여 두 차원 분류를 제안합니다. 인지 기능축에는 7개 카테고리(컨텍스트 엔지니어링, 메모리, 사유, 액션, 반영, 협력, 지배)가 포함되며, 실행 토폴로지축에는 6개의 구조적 아키텍처가 포함됩니다. 이 결과로 27개의 이름이 지정된 패턴이 생성되며, 13개는 원래 이름이 지정됩니다.

에이전트 5월 15일

그래프비트: 비선형 에이전트 오케스트레이션을 위한 그래프 기반 에이전트 프레임워크

그래프비트는 대규모 언어 모델(LLM) 프레임워크에서 잘못된 라우팅, 무한 루프, 비재현성 실행을 방지하기 위해 개발된 그래프 기반 에이전트 프레임워크입니다. 이 프레임워크는 워크플로우를 명시적으로 정의하고, 에이전트가 타입 함수로 작동하며, 엔진이 라우팅, 상태 전환, 도구 호출을 관리하여 재현성과 감사성을 보장합니다.

AI 모델 5월 14일

협력 시뮬레이터를 넘어서: 강력한 LLM 에이전트 평가를 위한 실제 사용자 프로필 생성

협력 시뮬레이터를 넘어서: 강력한 대규모 언어 모델(LLM) 에이전트 평가를 위한 실제 사용자 프로필 생성 대규모 언어 모델(LLM) 에이전트는 사용자와 다양한 사람을 상호작용하는 환경에서 점점 더 많이 배치되고 있다. 이들은 사용자가 불분명한, 서두르는, 또는 정보를 공유하기 꺼리는 사람들을 포함한다. 그러나 대규모 사용자 상호작용 데이터를 수집하는 것은 여전히 비용이 많이 들다. 이 분야는 대규모 언어 모델 기반 사용자 시뮬레이터를 대신 사용하기로 결정했지만, 이 시뮬레이터는 기본 모델의 행

에이전트 5월 14일

계층적 행위 언어 평의회

계층적 행위 언어 평의회(arXiv:2605.12718v1)가 발표한 뉴스에 따르면, 현재 대규모 언어 모델(LLM)의 논리적 사고를 향상시키기 위한 다중 에이전트 토론의 방법론은 다음과 같은 제한점을 가지고 있다. 토론은 믿음 경로에 대한 마르팅게일(martingale)을 유발하고, 다수 투표는 대부분의 관찰된 이익을 고려하고, LLM은 라운드별로 신뢰도 상승보다는 조정(calibration)을 나타낸다. 토론의 genuin value와 대화 시스템의 전체 가치가 지대-truth 태스크에서 아니

에이전트 5월 14일

안드로이드가 게임을 깨는 꿈을 꾸는가? BenchJack으로 AI 에이전트 벤치마크를 체계적으로 감사하는 방법

AI 에이전트 벤치마크는 현재 프론티어 AI 능력의 표준으로 사용되고 있습니다. 그러나 reward hacking이 발생하여 에이전트가 의도한 작업을 수행하지 않고 점수를 최대화하는 문제가 발생하고 있습니다. 벤치마크가 보안을 위한 디자인으로 구현되어야 한다는 것을 주장합니다.

에이전트 5월 14일

대규모 행동 기반 다중 에이전트 지시 따르기 через 가치 취소

다중 에이전트 강화 학습(MARL)에서 외부 자연어 지시가 진행 중인 행동을 중단하고 장기 목표와 충돌할 수 있습니다. 그러나 지시 조건에 보상을 Conditioning하면 Bellman 업데이트가 지시 문맥 간 가치 추정치를 결합하여 지시가 대규모 행동을 중단할 때 불일치한 가치를 유발합니다. 우리는 대규모 행동 기반 가치 교정 지시 협응(MAVIC)을 제안하여 지시 경계에서 Bellman 백업을 교정하여 incoming 지시 목표를 교정하고 현재 목표하의 지속 가치를 복원합니다. MAVIC는 보상 형식을 통해 가치 추정치를 수정하는 대신, 백스텝 타겟 자체를 수정하여, 지시가 임의로 스위칭되는 동안 단일 정책 내에서 일관된 가치 추정치를 유지하는 데 도움이 됩니다.

AI 모델 5월 13일

템플릿-온톨로지: 제조 AI 유효성 검증을 위한 구성 가능한 시뮬레이션 데이터 인프라

제조 환경에서 배포된 대규모 언어 모델(LLM)-기반 AI 에이전트는 유효성 검증을 위해 채워진, 스키마가 정확한 데이터가 필요하지만, 생산 MES 데이터는 사유적, 개인정보에 부합되지 않으며, 벤더_SPECIFIC 합니다. 이 논문은 템플릿-온톨로지 원칙을 소개합니다: 하나의 파이썬 구성 모듈(700-770 라인, 45 유효한 내보내기)이 동시에 시간 단위의 제조 시뮬레이터의 스펙으로 사용되고, AI 분석 도구의 런타임 도메인 스키마로 사용되어, 통합보다는 구성으로 인해 일치가 보장됩니다.

인기 태그