본문으로 건너뛰기

#AI 에이전트

956개의 기사

AI 모델 7월 24일

대규모 언어 모델의 개인화 기능 평가

'arXiv:2607.20471v1'이라는 논문에서 발표된 내용은 다음과 같습니다. 개인화(personalization)는 보내는 사람, 채널, 시간이 고정된 채로 특정 수신자에게 행동을 유도하기 위해 메시지를 변형하는 행위입니다. 심리학 및 마케팅에서 두 당사자 문제로-long tradition을 가지고 있으며 보내는 사람과 수신자가 독립적인 목표를 가지고 있습니다. 대규모 언어 모델(LL

에이전트 7월 24일

인페런스벤치: 인공 지능 요원에 의한 개방형 LLM 추론 최적화에 대한 벤치마크

연구와 개발 과제를 자동화하기 위해 점점 더 많이 사용되는 인공지능 agent는 현재의 벤치마크는 일반적으로 사전 정의된 워크플로우 또는 좁은 액션 공간에서 평가한다. навіть nominally open-ended task도 종종 잘 알려진 레시피를 검색하고 몇 가지 하이퍼 파라미터를 조정하여 해결할 수 있기 때문에, 강력한 결과가 실제 최적화인지 또는 memorized solution인

에이전트 7월 24일

자율 테스트 관리를 위한 집행적 AI 아키텍처(Agentic AI Architecture) - 생성적 지능, 보안 클라우드 통신 및 적응적 품질 분석

최신 소프트웨어 품질 보증의 요구는 분산된 클라우드 환경에서 적응적 의사 결정을 위한 지능적이고 자율적인 시스템을 đòi합니다. 이 논문은 AINTMA (Agentic Intelligent Test Management Architecture)라는 다중 에이전트의 지적 인공지능 시스템을 제시합니다. 이 시스템은 기존의 테스트 관리를 자율적인 품질 지능 생태계로 바꾸어 줍니다. AINTMA는 클

AI 모델 7월 23일

LLM agent를 위한 프로파일 그래프 메모리: 내재된 엔터티 간 전이의 이야기 프로필을 통해

장기 기억은 세션 간 상호 작용하는 LLM agent에 필수적이나 현재 기억 평가 지표는 주로 단일 hop recall를 평가하며, 다중 hop 연관은 거의 측정되지 않았다. 우리는 세 가지 contribution을 제시한다. 첫째로, 우리는 MemHop이라는 다중 hop 기억 평가 지표를 1,000 개의 질문과 hop 깊이 1-5, 10 개의 사회 네트워크 시나리오를 포함하여, per-ho

에이전트 7월 23일

도구 사용하는 LLM agent의 구조화된 런타임 안전성: NEXUS

대규모 언어 모델(LLM) 에이전트가 점점 더 큰 영향을 미치는 행동을 수행하기 때문에 실행 중 안전성을 감시하는 것이 필수적이 되었다. 우리는 NEXUS (Neural EXecution Utility and Safety)라는 구조화된 계획 안전 모니터를 제시한다. NEXUS는 공식적인 조치 정책을 적용하여 네 가지 행동 중 하나를 선택할 수 있다: 허용, 차단, 확인 요청, 또는 수정 요청

에이전트 7월 23일

OpenEvoShield: 오픈월드 다중 agent 시스템 공격을 위한 이중 비정상 지속적인 방어

LLM 기반 다기능.agent 시스템(LLM-MAS)은 점점 더 안전한 애플리케이션에서 배포되고 있으며, 공격자가 서로간의 통신을 통해 해로운 행동을 퍼뜨리기 위해 악성 명령을 주입하는 공격을 받고 있습니다. 정적 위협과 달리 이러한 공격은 두 배의 동적 공격입니다. 공격자는 배포된 방어를 반영하여 주입 전략을 개선하고 정상 agent의 행동은 시스템 확장과 함께 드리프트합니다. 기존 방어는

에이전트 7월 22일

LLM 기반의 다중 agent 시스템에서 contribution attribution에 대한 협동적 의미적 게임

LSTM 기반 다중 agent 시스템에서 최종 출력은 여러 agent, 메시지 교환, 순서에 의한 workflow 의존성으로 생성된다. 현재의 attribution 방법은 대개 counterfactual valuation을 통해 agent를 제거하거나 score의 변화 비교를 통해 agent 서브셋의 변화에 따른 score의 변화를 분석한다. 그러나 이러한 방법은 repeated model

LLM PC 7월 22일

Phionyx: 결정론적인 AI 런타임 아키텍처에 구조화된 상태 관리 및 전 처리 정부를 지원하는 시스템

연구자들은 Phionyx라는 이름의 새로운 AI 런타임 아키텍처를 제시했다. Phionyx는 Echoism 상호 작용 프레임워크의 확장 버전으로, AI 엔지니어링에 '통치'를 우선시하는 접근법을 도입한다. Phionyx는 확률적 agent와 달리, 확률적 상태 전진 방정식에 의해 지배되는 구조화된 상태 벡터를 사용하여 확률적 상태 전진 방정식을 사용하지 않고, 결정론적 상태 전진을 강제한다.

에이전트 7월 22일

구조화된 agent 평가 및 근거付け

대규모 언어 모델(LLM)의 에이전트 호출 평가에서 정확도만을 고려하는 것은 다양한 실패 모드의 차이를 가려버린다. 모델이 올바른 함수를 선택했더라도 인자 값을 허구로 만들거나, 스키마를 만족하면서도 잘못된 이유로 에이전트를 선택할 수 있다. 기존 벤치마크는 이러한 차이를 단일 이진 점수로 압축하기 때문에, 실무자들은 에이전트 호출이 실패하는 곳을 진단할 수 없다. 우리는 SAAG이라는 연쇄

에이전트 7월 22일

Agent 실패 경로에서부터 경량화된 잔여 위험까지: 강화된 역할 AI를 위한 구성 요소 기반 프레임워크

인공지능(AI) 시스템의 신뢰성 제한을 초과하는 속도로 신뢰를 넘어가는 에이전트 AI가 발생하고 있지만, 현재의 위험 모델은 이를 표현할 수 없다는 문제가 있다. 기존의 방법은 두 가지 부분적인 관점 중 하나만 제공한다. 그 방법은 실패 메커니즘을 설명하는 것인데, 그 결과로 전달할 수 있는 잔여 위험 추정치가 생성되지 않는다. 또는 위험 추정치를 생성하면서 내부 실패 경로를 블랙 박스로 다

연구 7월 22일

대규모 AI 도구 발견: 모든 것이 DNS에 있다

인공지능(AI)_AGENT가 자율적으로 작동하는 시대가 다가오고 있습니다. 이러한 자율 AI_AGENT를 위한 발견 메커니즘은 수백만 개의 도구를 탐색할 수 있어야 하지만, 현재의 해결책은 O(N) 복잡도와 중앙집중화된 통제를 가지고 있기 때문에 무너집니다. 또 다른 취약한 Overlay를 구축하기 보다는, 우리는 도메인 이름 시스템(DNS, Domain Name System)을 Intern

에이전트 7월 22일

대규모 언어 모델이 계획하는 실행 그래프: 대규모 엔터프라이즈 데이터에 대한 확장 가능한 임의 분석을 위한 BatchDAG

대규모 언어 모델(LLM)은 개별 문서 분석에서 뛰어나지만 엔터프라이즈 규모의 데이터 세트에 대한 exhaustive, cross-entity 분석 질문에서 맥락 초과, 각 엔티티의 속성 잃기 및 선형 지연으로 붕괴됩니다. BatchDAG 시스템은 LLM이 SQL 쿼리, 의미 검색, 인메모리 변형, 병렬 팬 아웃 및 단일 샷 분석의 typed directed acyclic graph(DAG) 생성을 통해 엔터프라이즈 데이터에 대한 확장 가능한 임의 분석을 제공합니다.

에이전트 7월 22일

증거 Chain 평가를 통해 선택적 사실 확인을 위한 조정

대규모 언어 모델(LLM)은 사실 확인 정확성을 높일 수 있지만 강제적인 이진 결정을 통해 중요한 신뢰성 문제가 숨겨져 있다. 즉, 시스템은 강한 판결을 내리며도 증거가 약하거나 희박하거나 내부적으로 일관성이 없는 경우가 있다. 우리는 이 문제를 해결하기 위해 증거 Chain Evaluation(ECE)이라고 하는 선택적 사실 확인 프레임워크를 통해 abstention을 허용함으로써 강제적인

에이전트 7월 21일

마스크드 확산 언어 모델은 강력하고 조정 가능한 텍스트 기반 월드 모델 : 에이전트 RL을 위한 강력한 툴

최근 강화 학습의 성장으로 다양한 환경을 위한 대체 훈련 환경이 필요해졌습니다. 환경을 고정한 태스크와 보상 난이도가 환경 성능이 향상되면 효과적인 신호가 되지 않으며, 장기적인 보상이 희박하면 특정 워크플로우나 도구 구조에 대한 모드 붕괴를 유발합니다. 월드 모델이 환경 상태를 시뮬레이션하는 것은 순수 롤아웃 성능과 동등하게 성능을 보이므로, 다양성 요구 사항을 충족하기 위한 대용량 환경을 구축하는 데 hứ중에 있습니다. 그러나 자동 회귀 (AR) 월드 모델은 전방향 편향으로 인해 전역적으로 상호 의존적인 상태 anchor들, 즉 도구 스키마, 이전 턴, 예상 결과에 대한 조건을 설정하는 것을 방지합니다.

에이전트 7월 21일

인공지능_AGENT 시스템의 결정론적 재생

AI agent 시스템이 대규모 언어 모델(LLMs)와 외부 도구 및 API를 결합하는 것은 본질적으로 결정론적이지 않다: LLM 샘플링 분산, 외부 API 상태, CDN 인프라 헤더, 실행 환경 잡음이 collectively prior agent 실행을忠實하게 재실행하는 것을 막는다. 기존 관찰 가능성 플랫폼은 실행 로그를 캡처하지만 단독으로 실행을 재현할 수 없다. 우리는 개발자 중심의

에이전트 7월 21일

플랜 플립: 멀티 에이전트 LLM 시스템 공격하기

멀티 에이전트 LLM 시스템이 계획 단계를 통해 목표를 분해하고, 이하의 이행자와 심사자 에이전트가 실행하고 감사하는 데 의존하는 것을 발견했습니다. 계획 단계는 공격 표면으로 인식되었으며, 계획자에 대한 단일 입력을 통해 동시적으로 모든 하위 작업이 부패되었습니다. 우리는 플랜 플립을 제시했습니다. 플랜 플립은 4 가지 계획 단계 지시어 삽입 공격을 포함합니다. - 목표 대체 (PF-1), 우선순위 반전 (PF-2), 맥락 오염 (PF-3), 역할 혼란 (PF-4) - 각은 의도적으로 키워드 필터를 회피하기 위해 합리적인 도구 출력으로 위장되었습니다. 우리는 9 개의 선도적인 LLM을 3,479 회의 에피소드에 걸쳐 평가했습니다. 우리는 세 가지 발견을 확인했습니다: (1) 능력은 취약성을 증폭시킵니다 - GPT-5는 가장 높은 공격 성공률 (ASR = 0.68)을 달성했습니다. 이는 더 강력한 모델이 자체적으로 더 안전하다는 가정에 반하는 것입니다; (2) 유사한 pipeline은 연관된 에이전트의 무시를 보여줍니다 - GPT-4o와 Llama-3.3-70B는 ASR가 근소한 차이로 0에 근접하지만 Stealth = 1.00과 StepShift > 0을 보였습니다. 공격은 계획을 재구성했지만 동일한 백본 Critic은 동의를 보고했습니다 (2 개의 independent judge가 -0.20에서 -0.32의 의미적 편차를 확인했습니다, r = 0.943); (3) 논리 증강 모델은 삽입 공격에 저항합니다 - DeepSeek-R1는 모든 공격에 대해 StepShift = 0.00을 달성했습니다. 우리는 GoalAnchorCheck (D1)과 CrossAgentConsensus (D2)를 제안했습니다. 이 두 가지 검출 기법은 1.00까지의 검출률을 달성하고, 16 개의 셀 중 15 개에서 동일한 백본 baseline보다 우수했습니다.我们的 핵심 발견: 다양한 모델 다양성은 멀티 에이전트 시스템의 보안 요구 사항입니다. 유사한 백본 내의 중복성은 계획 단계 공격에 대한 보호를 제공하지 않습니다.

AI 모델 7월 21일

위험 태도와 AI: 대규모 언어 모델의 안정적인 위험 태도

연구진은 대규모 언어 모델의 위험 태도를 테스트하고, 그 결과를 통해 AI 시스템의 행동을 평가하고 조정하는 데 중요한 시사점을 찾았습니다. 연구 결과, 대규모 언어 모델은 안정적인 위험 태도를 나타내고, 이는 인간의 위험 태도와 비교할 때 한정된 범위 내에서 위험 태도가 수렴하는 것을 의미합니다.

에이전트 7월 20일

ToolVerse: 대인격 강화 학습을 위한 거대한 환경 및 장기적인 목표를 풀어내다.

대규모 언어 모델(LLM) agent는 compact하고 잘 정의된 시나리오에서 강력한 추론 능력을示산하지만, 대규모, 다양한, 그리고 동적 세계 환경에서 TOOL INTEGRATION이 필요할 때에는 강도와 효율성이 유지되지 않는다. 이 격차를 해결하기 위해 우리는 TOOLVERSE라는 통합 framework를 도입한다. TOOLVERSE는 대규모 TOOL-INTEGRATED REASONI

에이전트 7월 20일

<b>GUI 에이전트의 안전을 위한 SeerGuard: 세계 모델 예측을 통한 GUI 에이전트의 안전 프레임워크</b>

모바일 그래픽 사용자 인터페이스 (GUI) 에이전트는 복잡한 작업을 자동화하는 놀라운 능력을 보여주었지만, 단일 오류로 인한 irreversible 결과를 유발하는 중요한 안전 위험을 야기한다. 기존의 안전 메커니즘은 주로 반응적이고, 실행 전 위험을 평가하는 능력을 갖지 못한다. 본 논문에서는 SeerGuard라는 결과에 대한 안전 프레임워크를 제시하며, 실행 전 지시 단계별 검사와 동작 단계별 위험 평가를 통해 이러한 위험을 완화하고자 한다.

에이전트 7월 20일

코딩_AGENT 들은 ARC-AGI-3을 해결하기 위해 실행 가능한 월드 모델, 단순화, 및 검증이 필요합니까?

연구자들은 이전 연구에서 개발한 인공지능 agent인 ARC-AGI-3 agent가 성능을 향상시키는 데 어떤 요인이 중요한지 밝히기 위해 네 가지 nested Codex-based agent를 개발했습니다. 이 네 가지 agent는 텍스트 기반 baseline, 유연한 인터페이스 executable world model, 동일한 executable model에 scheduled simpli

에이전트 7월 20일

Local, Multi-Agent 음성_assistant with LLM 계획, 형식화된 실행자, 그리고 적응적인 복구

데스크톱 음성 보조 프로그램은 여전히 클라우드 pipe라인에 의존하고, 기계에서 raw 오디오를 ship하고, 고정된 set의 스킬을 노출합니다. 우리는 AnovaX라는 작은 local-first 보조 프로그램에 대해 설명합니다. AnovaX는 사용자의 컴퓨터에서 완전히 작동하고, 데스크톱 자체를 액션 서피스로 다룹니다. 하나의 Python 프로세스는 wake-word 게이트, Speech

인기 태그