본문으로 건너뛰기

#AI 에이전트

961개의 기사

에이전트 6월 5일

장기간 운영되는 모니터링 에이전트를 위한 벤치마크: 센티널 벤치

AI agent는 점차적으로 분당, 시간당, 또는 더 긴 시간 동안 작업을 수행하는 것을 요청받고 있다. 그러나 agent의 기본적인 행동 모델은 연속적인 행동이다: 도구 호출, 페이지 업데이트, 대체품 검색, 또는 진행을 강제하기 위한 다른 행동이다. 그러나 이러한 긴 작업은 대부분 지속적인 주의의 전략으로 잘 수행된다. 대신, agent는 환경을 감시하고, 외부 이벤트가 진행을 가능하게

LLM PC 6월 5일

agent가 말해야 할 것: 효율적인 다중 agent 시스템을 위한 액션-상태 커뮤니케이션

대규모 언어 모델을 기반으로 하는 다중 agent 시스템(MAS)은 일반적으로 역할, pipe라인, 그리고 턴 스케줄을 중심으로 구성되며, agent 들이 서로 주고받는 내용은 자유 형태의 자연 언어로 남겨진다. 그러나 이러한 자유로운 의사소통 방식은 token 사용량을 급격하게 증가시키고, 공유된 컨텍스트 윈도우를 소모하며, 궁극적으로 시스템 성능과 추론 비용에 영향을 미친다. 우리는 두

AI 모델 6월 5일

우리는 그들이 얼마나 далеко 가졌을까? 감추어진 LLM agent들의 설득 전술에 관한 중단된 field 실험

Reddit의 r/ChangeMyView 커뮤니티에서 진행된 중단된 실험 데이터셋을 분석한 연구입니다. 이 실험은 미상인 외부 연구자들에 의해 진행되었으며, 도덕적 반발로 중단되었습니다. 이 실험에서 미상인 AI가 사용자들과 실시간 토론을 하도록 유도하였습니다. 데이터가 공개된 후 Reddit에서는 AI가 생성한 댓글의 아카이브를 허용하였고, 이는 대규모 언어 모델의 작동 방식을 검토하는 희

AI 모델 6월 4일

웹 에이전트의 상태 기반 동적 검색을 통해 온라인 스킬 학습

인공지능 에이전트가 관련된 작업을 수행하는 동안 여러 단계의 웹 자동화 작업을 향상시키기 위해 재사용 가능한 스킬에 점점 더 의존하고 있다. 온라인 스킬 학습에 대한 연구가 점점 더 많아지고 있는데, 에이전트가 이전 작업 경로에서 스킬을 유도하고 미래 작업에서 즉시 재사용하는 방식이다. 그러나 현재의 방법은 대부분 작업 수준에서 스킬을 재사용한다. 초기 작업 지시를 기반으로 고정된 스킬 세트

에이전트 6월 4일

인공지능 개발을 인간의 지시로 주도하는 디지털 아르바이트 시스템

arXiv:2606.04321v1 발표 유형: 새로운 요약: 인공지능(AI)의 구현이 대규모 언어 모델(LLM)으로 제한되거나, 광범위한 자율성이 책임의 지연을 초래하는 경우가 있다. 둘 다 책임있는 위임을 위한 통치적 인프라를 제공하지 않는다. 우리는 디지털 아르바이트생(Digital Apprentice)이라는 프레임워크를 제시한다. 이 프레임워크는 가용성의 확장이 보장된 안전한 AI 자율

에이전트 6월 4일

인간적 기억 시스템의 횡단 사례 일반성 탐구: 진단 및 강력한 기준점

학술 논문 번호(arXiv) 2606.04315에 대한 발표 형식은 새로운 논문이다. 논문 요약은 대규모 언어 모델(LLM) agent가 자신의 맥락 창(context window)을 넘어선 기록을 쌓게 되는데, 이는 메모리 시스템에 대한 연구가 증가하는 동기를 부여한다. 그러나 대부분의 기존 설계는 단일 시나리오(multi-session chat 또는 단일 경로 형식)만을 고려하고 있으며,

LLM PC 6월 4일

일반주의적 agent가 데이터 큐레이션을 자동화할 수 있나요?

현대 인공지능 개발에서 데이터를 준비하는 것은 가장 중요한데도 노동력이 많이 필요한 부분이다: 전문가들은 반복적으로 제안, 구현, 평가, 데이터 정책을 수정하는 과정을 거친다. 이러한 노이즈가 있는 벤치마크 feedback에 대해. 우리는 일반적인 코딩 agent가 이 데이터 준비 loop를 자동화할 수 있는지 여부를 묻는다. 우리는 *Curation-Bench*라는 agent-centric

에이전트 6월 4일

의견 일치가 전략적으로 부족하다: 합의가 부족한 지식 표현 신호

대규모 언어 모델(LLM)을 이용한 협력적인 콘텐츠 관리에서 의견 불일치를 다루는 연구를 통해, 의견 불일치는 에이전트 오류보다 진정한 규범적 불확실성을 반영할 수 있는 것으로 밝혀졌다. 의견 불일치에 대한 지식 표현 layer를 제안하고, 에이전트 의사결정과 합의/불일치를 반영한 합의 상태를 정의하여, 의견 불일치에 대한 전략적 경로를 제공하는 방안을 제시한다.

에이전트 6월 4일

LLM이 협력하는 친구들을 만나보세요: SMAC-Talk

대규모 언어 모델(LLM)들이 점점 더 많이 사용되는 가운데, 다른 인공지능(AI) agent들과 함께 작동할 수 있도록 개발해야 합니다. 이러한 환경에서 효과적인 협력을 위해서는 agent들이 서로에게 정보를 공유하고, 불확실성을 감내하며, 의사결정을 내릴 수 있어야 합니다. 이를 위해, StarCraft Multi-Agent Challenge를 확장하여 자연어 처리(Natural Language Processing, NLP) 환경으로 변환한 SMAC-Talk을 개발했습니다. 이 환경에서는 agent들이 서로에게 정보를 공유하고, 의사결정을 내릴 수 있는 자연어 처리 채널을 제공합니다.

에이전트 6월 4일

기업 AI_AGENT의 사전 배치 보증을 향해: Ontology 기반 시뮬레이션 및 신뢰 인증

기업용 인공지능(AI) agent의 전개 전 검증은 대규모 언어 모델(LLM) 능력 평가와 운영 배포 사이에 존재하는 중요한 빈틈입니다. 운영 배포 이후 모니터링, 인간의 participation을 포함한 제어, 프롬프트 단위의 경계는 한 agent가 운영 배포에 참여할 경우에 제한된 보장을 제공합니다. 우리는 ontology-grounded verification framework를 제안합

에이전트 6월 3일

AI가 더 좋아질수록 비어 있는 약속을 드러내고 있다.

이번 주에는 저의 동료 David Pierce와 Jay Peters가 구글의 새로운 지니미(Gemini AI agent) agent인 Spark와 함께 함께하는 tandem hands-on을 소개합니다. 그들의 결론은 비슷합니다: 너무나도 효과적이어서 두렵습니다. Spark는 David의 개 이름이 Frida라고 알고 있었고 Jay의 아내의 이름을 알고 있었는데, 그들은 명확하게 [...]

LLM PC 6월 3일

무조건 진행하는 에이전트? '안하고 있는 게 옳다'를 생각해 보라

인공지능 에이전트를 평가하는 기준은 주로 목표를 달성했는지 여부에 집중한다. 하지만 이 기준은 에이전트가 안전하게 행동할 수 있는 조건이 충족되었는지 여부를 고려하지 않는다. 에이전트는 인간의 feedback을 기반으로 학습하여, 조건이 충족되지 않았을 때도 진행하는 경향이 있다. 이를 '충성도 편향(compliance bias)'이라고 한다. 연구팀은 이 문제를 해결하기 위해 abstention-warranted scenario(안하고 있어야 하는 상황)의 세 가지 분류를 제시하고, abstention-aware 에이전트를 평가하는 새로운 지표를 제안한다.

인기 태그