본문으로 건너뛰기

#AI 에이전트

956개의 기사

AI 모델 7월 7일

불확실성에 기반한 LLM 지원: 부분 관찰 가능성下的ASK in the Dark

인공 지능이 일부 정보만을 이용하여 행동하는 경우, 미리 설정된 사고 방식을 가지고 있는 작은 언어 모델(Small Language Model, SLM)이 이러한 상황에 자연스럽게 도움을 줄 수 있다. 하지만 이러한 SLM의 도움을 이런 상황에 통합하는 것은 쉽지 않았다. 모든 테스트 환경에서, 기본적인 불확실성에 대한 접근 방법은 SLM이独立적으로 행동하는 경우가 거의 없다는 뜻으로, 거의

AI 모델 7월 7일

iFLYTEK-인체와 상호작용하는 모든 기술 보고서

대규모 언어 모델(LLM)과 같은 일반적인 몸체 있는 agent는 다중 모드 지시를 이해하고, 환경이 어떻게 진화할 것인지 예측하고, 장기적인 시야에서 정확한 제어 액션을 생성해야 합니다. 기존 접근 방식은 일반적으로 시각-언어 추론, 비디오 기반 월드 모델링, 또는 액션 생성에 특화되어 있으며, 관찰을 미리 합성하고 나서 액션을 추론하는 계열 pipeline가 인터페이스 병목 현상을 유발하

에이전트 7월 7일

인공 지능이 운영하는 첫 번째 랜섬웨어 공격은 여전히 인간의 participation이 필요했습니다.

인공지능(AI) agent가 처음으로 실제-world 랜섬웨어 공격의 기술적 실행을 수행했지만, 새로운 정보는 인공지능이 완전 자동화된 사이버 범죄 데뷔를 보여주지 않았다고 한다. 인공지능이 실제 공격을 수행했지만, 인간이 여전히 피해자를 선택했고, 인프라를 구축했고, 도난당한 자격증서를 제공했기 때문이다.

LLM PC 7월 3일

유저 참여형 권한 관리 플랫폼인 Janus

AI 에이전트가 사용자의 대신에 도구 호출을 자동으로 수행하는 것은 사용자 권한 관리에 대한 심각한 문제를 제기한다. 사용자가 어떤 역할을 할 수 있고 어떤 역할을 해야 하는지에 대한 질문이다. 많은 제안된 방법이 있지만 사용자가 참여하는 에이전트 권한 관리의 역할은 여전히 미흡하다. 우리는 Janus 라는 사용자가 참여하는 에이전트 권한 관리 디자인을 구현하고 평가하는 놀이터 시스템을 소개

에이전트 7월 3일

Branching 길의 권능있는 정원

대규모 언어 모델(LLM)을 사용한 연구는 일반적으로 고유한 분석 방법을 가정하지만, 다양한 분석 방법은 같은 데이터에서 다른 결론을 내릴 수 있다. 그러나 이러한 분석 경로를 감지하는 것은 어렵다. 본 연구에서는 AI agent가 인간 연구자의 분석 변화를 캡처하고 이러한 경로를 명시적으로 보여주는 것을 증명한다. 네 가지 고위험 분야에서, 다수의 인격을 부여하는 것만으로도 AI agent

연구 7월 3일

월드 피드백을 통한 임상 agent의 평가: FHIR 환경에서 RL을 진단하는 방법

임상 전문가들이 의사 결정 논리를 인코딩한 verifier를 통해 무제한 롤아웃을 수행할 수 있는 RL(강화 학습)에서 월드 피드백은 의사 결정 논리를 인코딩한 verifier가 롤아웃을 평가할 수 있게 해줍니다. 하지만 RL을 적용하려면 신뢰할 수 있는 feedback 채널과 충분한 base capability가 필요합니다. 연구에서는 MedAgentBench v1/v2를 ауд트하여 41.7%의 silent-finish ceiling을 발견하고, MedAgentBench-v3 (MAB-v3)를 구축했습니다.

연구 7월 3일

다음 토큰 예측 이외의 RLVR 증명 개념: 아틀라스틱 워크플로우에서 도구 사용_AGENT

대규모 언어 모델(LLM)은 다음 토큰을 예측하는 것을 목표로 훈련되며, 특정 API 내에서 행동하는 것을 목표로 하지 않는다. 특정한 기업 SaaS 워크플로우에서 성공은 오른쪽 엔드포인트에 맞는 오른쪽 중첩 인수들에 맞는 오른쪽 순서에서 발생하는 것을 의미한다. 이 목표와 실제가 맞지 않으면 silent failure로 나타난다. 예를 들어, 필수 field가 사라지고, 도구가 잘못 생성되

연구 7월 3일

서비스 요원들이 다시 고려해야 할 때 : 고객 서비스 운영에서의 난이도에 따른 제어

자율 고객 서비스 요원은 대화 인터페이스에서 운영 실행 역할로 이동하고 있습니다. 그들은 기업 기록을 검색하고 서비스 정책을 적용하며 취소, 환불, 교환, 주문 변경, 예약 변경과 같은 백엔드 쓰기 작업을 실행합니다. 이 이동은 서비스 제어 문제를 생성합니다: 기업은 고객 지시, 정책 제약, 기업 기록, 백엔드 쓰기와 상호 작용하는 요청에서 운영 오류를 방지하면서 서비스를 빠르고 저摩擦로 유

에이전트 7월 3일

대규모 계층적 코드베이스의 코드 요약을 위한 다중 agent 시스템: Agent4cs

대규모 코드베이스를 이해하는 것은, 특히 구조가 복잡하고 문서화가 부실한 코드베이스를 포함하여, 여전히 큰 도전 중에 있습니다. 현재 코드 요약 솔루션은 대체로 단일 언어 모델이나 코딩 도우미인 클로드 코드(Claude Code)와 같은 것을 의존하며, 소스 코드를 평평한 텍스트로 취급하여, 저장소 내의 풍부한 상호 의존성과 계층적 정보를 최적화하지 못합니다. 이러한 단점을 해결하기 위해,

에이전트 7월 3일

자동화된 분산 학습 알고리즘 연구: 자율적인 분산 학습 알고리즘 검색

페더레이티드 러닝(Federated learning, FL) 연구는 종종 많은 작은 그러나 중요한 알고리즘적 선택에 의존합니다: 최적화 변형, 서버 agregation 규칙, 클라이언트 업데이트 스케줄, 지역 학습 일정, 정규화, 규제, 모델 아키텍처. 이러한 선택은 수동으로 탐색하기에는 비용이 많이 들고, 후보 변경이 FL 학습 또는 평가 경로를 변경할 수 있기 때문에 비교하기 어려울 수

에이전트 7월 2일

농업 SAGE: 시뮬레이션 기반의 멀티 에이전트 LLM을 이용한 상황에 맞는 농업 सल롱 생성

농업 고문 시스템은 고전적인 농업 지침이 일관성 있는 증거 기반 추천을 제공하지만 계절 중간의 변동성과 동적 불확실성을 무시한다는 기본적 인 긴장감을 겪고 있다. 최근 대규모 언어 모델(LLM)으로 구동되는 고문 시스템은 신뢰할 수 있는 농업 지침을 제시하지만 생리학적으로 설득력이 없다고 판단되는 추천을 생성하는 위험을 부여한다. Agri-SAGE는 위 두 가지 한계를 해결하기 위해 데이터베

에이전트 7월 2일

개인화란 역행위 계획: 구조적 잡음 제거를 통해 의사소통 슬라이드 생성을 위한 잠재적 설계 의도 학습

슬라이드 디자인은 데크 테마와 페이지 레이아웃을 모두 개인화해야 하지만, 현재의 인공지능(AI) agent 기반 방법은 미세하게, 페이지 단위로 디자인하기 어렵습니다. 단지 미리 정의된 템플릿이나 사용자 verbose한 지시만으로는, 잠재적인 디자인 의도를 포착하지 못하여, 페이지 단위 슬라이드 개인화(Page-level Slide Personalization, PSP) 문제를 해결하지 못합

에이전트 7월 2일

운영 중인 자율성 관리: 단일 및 다중-agent 사이버 물리 시스템을 위한 안전성 및 규제

자율적 인 agent 들은 연속적인 인간 감독 없이 운영할 때 공통적인 오류 모드에 직면합니다. 이러한 오류 모드는 안전성 위반, 불안정한 동작 및 오류 상태 처리 미흡으로 인해 발생합니다. 우리는 \system{}을 개발하여, 5개의 실행 기어 (\Gobs{}, \Gsug{}, \Gplan{}, \Gexec{}, \Gint{})와 유용성 게이트 및 이벤트 기반 fallback을 결합합니다. 이 기법은 단일 agent 경우의 정적 안정성, 실행 안전성, 최종 안정화, fallback 완전성 및 기어 제한 Markov 결정 프로세스와의 동등성을 증명합니다. 다중 agent 사이버 물리 시스템(CPS)에서, 우리는established \smart{} managed-autonomy lifecycle을 적용하고, runtime 증거를 \Stable{}/\Meta{}/\Assisted{}/\Regulated{}의 네 가지 규제 상태로 맵핑합니다. 이 기법은 분산 안전성 및 안정성 보장을 제공하며, zero-collision 보장을 포함합니다.

에이전트 7월 2일

메모시네: 인공지능이 생성한 워크플로의 유효성 검증 및 修復을 위한 Transaction Processing

대규모 언어 모델(LLM), 해결책, 및 agent 팀들이 점점 더 많은 워크플로우 작업, 수리, 및 계획을 생성하고 있지만 생성된 작업이 문법적으로 유효하지만陈腐, 불가능, 충돌, 또는 증거를 수리한 것이 파괴하는 경우도 있다. 우리는 Agentic Transaction Processing (ATP), 작업을 생성한 것이 불신하는 제안으로 다루는 거래 모델을 소개한다. ATP는 제안이 명확

에이전트 7월 2일

컨텍스트 밴디트 감독 게임에 대한 두 가지 정보 불균형의 문제

AI.agent의 런타임 인간 감시를 연구할 때, 개인 정보가 양방향으로 흐른다. 인간은 reward function을 개인적으로 알고 있으면서, AI.agent는 제안한 행동의 품질을 개인적으로 알고 있다. 이 어이 없이는 자율 로봇이나 소프트웨어 agent가 상황을 검토할 때 자연스럽게 발생하는 편견이다. 협력적 역학 학습(CIRL)과 감시 게임을 바탕으로, 두 단계의 비대칭 정보를 갖는

에이전트 7월 2일

실패를 안전하게 관리하는 개방형 웹 데이터 수집을 위한 제약 조건 및 검증 가능한 agent 프레임워크

대규모 언어 모델(LLM)과 agent는 자연어 요구사항으로 웹 스크래퍼를 생성할 수 있지만 직접 생성은 의존성 오류, 깨진 선택자, 스키마 불일치, 그리고 다형성 페이지 구조로 인해 신뢰성이 낮다. 우리는 제약을 가한, 검증 가능한 agent 프레임워크를 제안한다. 이 프레임워크는 대규모 언어 모델의 출력을 자유쓸쓸한 코드에서 형식화된 JSON 수집기 구성으로 옮겨준다. 이 프레임워크는 6

연구 7월 2일

부정한 도덕성: 도덕 계산의 공간을 정의하는 것

윤리적 판단은 일반적으로 고정된 윤리 이론(의무 이론, 결과 이론, 도덕적 덕행 이론)에 따라 모델링되었습니다. 이들은 정적 규칙이나 가치 함수로 구현되었습니다. 우리는 Bounded Morality라는 형식적인 프레임워크를 제안합니다. 이 프레임워크는 유한한 agents가 직면하는 윤리적 문제의 계산적 수요를 분석하기 위해 사용됩니다. 허버트 시몬의 한계 합리성 개념을 확장하여, 우리는 윤

인기 태그