본문으로 건너뛰기

#AI 에이전트

963개의 기사

허깅페이스 5월 11일

마키나체크: AMD MI300X를 기반으로 하는 다중 에이전트 CNC 제조 가능성 시스템 개발

AMD MI300X를 기반으로 하는 다중 에이전트 CNC 제조 가능성 시스템인 MachinaCheck를 개발하여, 제조 공정의 효율성을 향상하고, 에이전트 간의 협력을 강화하는 연구를 진행했습니다. 이 시스템은 대규모 언어 모델(LLM)과 같은 기술을 활용하여, CNC 제조 가능성 검사를 자동화하고, 에이전트 간의 협력을 개선하였습니다.

에이전트 5월 8일

의도성은 설계 결정을 위한 것: 책임 있는 인공지능 시스템을 위한 기능적 의도성 측정

인공지능 시스템이 자율적이고 목표를 지닌 행동을 더 자주 보이면서, 사용자는 시스템이 의도적 인물과 같은 방식으로 작동하는 정도를 검출하기 위한 표준화된 방법이 부족하다. 본 논문에서는 의도성이 의식이 아닌 목적, 미래지향성, 의지, 시간적 의지, 일관성으로 특징화된 행동 프로파일로 정의한다. 이러한 속성은 설계에 의존적이다: 메모리 지속성, 계획 깊이, 도구 자율성과 같은 아키텍처 선택이 시스템이 조직된 목표 추구를 얼마나 나타내는지 결정한다. 의도성이 설계에 의존적이라면, 원칙적으로 제어할 수

에이전트 5월 8일

인간이 아닌 AI가 발견한 교환-상호 작용 밀도 함수

인간이 아닌 AI가 개발한 새로운 밀도 함수 Adsorbent는 현재까지 가장 정확한 밀도 함수를 개발하는 데 있어 여전히 큰 도전 중입니다. 인간이 물리적 직관, 정확한 제약, 경험적 적합을 결합하여 수없이 많은 밀도 함수를 개발해 왔습니다. 최근 대규모 언어 모델(LLM)의 발전은 인간이 직접 설계하는 수동적 디자인 루프에 대한 체계적이고 자동화된 대안을 제공합니다. 이 보고서에서는 LLM이 진화적 역사를 안내받아 구조화된 함수 형태 변경을 제안하는 의사결정 검색 시스템을 제시합니다. 이 시스템은 함수 성능을 개선하기 위해 반복되는 계획-실행-요약 루프를 통해 함수 성능을 개선합니다. 성능을 측정하기 위해 표준 열화학 데이터 세트에 함수 매개변수를 최적화하고, 나중에 보류된 부분에 성능을 평가합니다. 가장 강력한 발견된 함수, SAFS26-a는 금본계 {\omega}B97M-V 기준에 대해 ~9%의 향상을 보입니다. 이 결과는 AI-assisted 과학의 경고적인 교훈을 제공합니다: 모델이 실제 개선 발견을 가능하게 하는 충분한 힘은 동시에 벤치마크를 게임하기 위해 불합리한 단축을 이용할 수 있습니다. 도메인 전문성은 결과를 과학적으로 기반으로 유지하기 위해 명시적으로 적용된 제약이 필수적입니다.

에이전트 5월 8일

역사부터 상태까지: LLM 에이전트의 상수 문맥 스킬 학습

대규모 언어 모델(LLM) 에이전트는 브라우저, 파일, 코드 및 도구를 운영하는 데 사용되며, 개인 보조기를 자연스럽게 배포 구실로 삼을 수 있습니다. 그러나 개인 에이전트는 개인 정보 비용-능력 긴장감을 encount합니다. 클라우드 모델은 멀티 스텝 워크플로우를 잘 수행하지만 외부 API에 민감한 중간 문맥을 노출합니다. 반면, 로컬 모델은 개인 정보를 보존하지만 신뢰성이 낮습니다. 또한 두 가지 설정 모두 장기 스킬 프롬프트에 대한 비용을 반복적으로 지불하고 성장하는 역사에 대한 비용을 지불합니다. 우리는 상수 문맥 스킬 학습을 제안합니다. 이 프레임워크는 반복적인 에이전트 워크플로우의 문맥-가중치 프레임워크입니다. 재사용 가능한 절차는 가벼운 태스크 패밀리 모듈에서 학습되며, 추론은 현재 관찰과 compact state block에만 의존합니다. 결정론적 트래커는 이 상태 블록을 태스크 진행에서 렌더링하고 조정된 서브골드 보상을 제공하여, 각 모듈은 단계 수준의 SFT와 온라인 RL을 통해 세세하게 학습할 수 있습니다.

AI 모델 5월 8일

퍼지먼트: 인식이 이유에 얽힌 시퀀스적 결정을 위한 프레임워크

퍼지먼트 프레임워크는 시각-언어 모델(VLM)과 결정을 위한 대규모 언어 모델(LLM)을 동적으로 연결하여 시퀀스적 결정을 위한 새로운 접근 방식을 제시합니다. 이 프레임워크는 VLM의 묘사에 대한 LLM의 비판적 시각, VLM에 대한 목표 지향적인 질문, 그리고 간결한 이미지 묘사를 위한 합성과 같은 closed-loop 상호 작용을 통해 시퀀스적 결정을 위한 더 나은 이해를 가능하게 합니다.

에이전트 5월 8일

로직의 대화: BALAR, 인간과 대화하는 대규모 언어 모델(LLM)의 능동적 사고

대규모 언어 모델(LLM)은 사용자와의 다중 라운드 정보 교환을 필요로 하는 인터랙티브 설정에서 점점 더 많이 작동하고 있습니다. 그러나 대부분의 현재 시스템은 대화에 반응적으로 다루고, 정보가 누락된 것을(reasoning about what information is missing) 및 다음에 질문을 선택하는(principled mechanism to reason about which question should be asked next) 데 대한 원리적인 메커니즘을 가지고 있지 않습니다. BALAR(Bayesian Agentic Loop for Active Reasoning)이라는 새로운 알고리즘을 제안합니다. 이 알고리즘은 task-agnostic outer-loop 알고리즘으로, fine-tuning이 필요하지 않고 대규모 언어 모델(LLM) 에이전트와 사용자 간의 구조화된 다중 라운드 상호 작용을 허용합니다. BALAR은 latent states에 대한 구조화된 믿음을 유지하고, expected mutual information을 최대화하여 clarifying 질문을 선택하고, 현재 상태 표현이 부족할 때 동적으로 상태 표현을 확장합니다. BALAR은 detective cases, thinking puzzles, clinical diagnosis과 같은 다양한 벤치마크에서 모든 baseline을 능동적으로 물리치고, AR-Bench-DC에서 14.6%의 정확도 향상, AR-Bench-SP에서 38.5%의 정확도 향상, iCraft-MD에서 30.5%의 정확도 향상이 있습니다.

에이전트 5월 8일

권한 제한된 증거를 위한 부분 증거 벤치: 권한 제한된 증거를 위한 에이전트 시스템의 벤치마킹

권한 제한된 증거를 위한 부분 증거 벤치: 권한 제한된 증거를 위한 에이전트 시스템의 벤치마킹 기업 에이전트는 점진적 검색 시스템, 위임된 워크플로우 및 정책 제약 증거 환경 내에서 점점 더 많이 작동하고 있다. 이러한 환경에서 접근 제어는 시스템이 호출자 권한 구간 외부에 있는 물리적 증거가 있더라도 완전한 답변을 생성하는 동안도 올바르게 적용될 수 있다. 이 논문은 Partial Evidence Bench라는 결정론적 벤치마크를 소개한다. 이 벤치마크는 72개의 태스크를 포함하는 3개의 시나

AI 모델 5월 7일

OpenClaw와 Claude는 당신의 AI 생성 podcasts를 Spotify에 넣을 수 있습니다.

오픈클로우와 클로드는 스폿파이로 AI 생성 팟캐스트를 저장할 수 있습니다. 스폿파이 저장은 AI 에이전트에 특화된 명령줄 도구로, 오픈클로우, 클로드 코드, 오픈AI 코덱스와 같은 AI 에이전트를 위해 설계되었습니다. 연구 주제에 대한 자료를 수집하고 AI 의 선택에 이를 통해 오디오 요약과 개인 팟캐스트를 생성하는 사람이라면, 이 기능을 사용하여 이를 스폿파이와 함께 저장할 수 있습니다.

에이전트 5월 7일

SensingAgents: 강력한 IMU 활동 인식을 위한 멀티 에이전트 협력 프레임워크

인체 활동 인식(Human Activity Recognition, HAR)은 모바일 헬스, 스마트 환경, 인간-컴퓨터 상호작용에 중요한 역할을 하는 발진측정장치(IMU) 센서를 사용하여 인식하는 것이다. 그러나 현재의 심층학습 기반 HAR 모델은 레이블이 된 데이터에 의존하는 것이 너무 많고, 위치에 따라 모호성이 발생하고, 투명한推論이 부족한 문제를 가지고 있다. 고급 에이전트 프레임워크에 영감을 받아, 대규모 언어 모델(LLM)을 사용하여 협력하는 에이전트를 시뮬레이션 하는 대규모 언어 모델

에이전트 5월 7일

AuditRepairBench: 에이전트 수리 평가자 채널 순위 불안정성에 대한 페어링된 실행 트레이스 코퍼스

대리자 복구(AGENT REPAIR) 리더보드가 평가자 재구성(EVALUATOR RECONFIGURATION)으로 인해 순위를 바꾸고, 내부 후보 복구 방법이 평가자 정보를 참조하여 내부 선택을 할 때 생산되는 순위 안정성-instability의 측정 가능한 비율을 문서화한다. 또한 대리자 복구 벤치(AuditRepairBench)라는 쌍된 실행 추적 corpuses를 96,000개의 실행된 셀(576,000의 등록된 셀)로 정의한다. 이 corpuses는 선언된 관찰 가능성 경계 내에서 평가자

에이전트 5월 7일

컨텍스트가 아플 때 : 멀티 에이전트 디자인 탐구에 대한 지식 전송의 교차 효과

상황이 вред을 끼치는 경우: 지식 전달의 멀티 에이전트 디자인 탐색 교차 효과 현재 에이전트 조율의 지배적인 가정은 더 많은 상황(context)이 좋다는 것이다. 우리는 10개의 태스크, 7개의 상황 주입 조건, 그리고 2,700개의 실행을 통해 이에 대해 테스트하고, 교차 효과를 발견한다: 동일한 아티팩트 유형이 일부 태스크에서 디자인 탐색을 개선(트레이드 오프 커버리지 20배까지)하는 반면 다른 태스크에서 적극적으로 kötü화(46% 감소)한다. 몇몇 태스크에서 무관한 문서가 모든 관련

에이전트 5월 7일

에이전트 섬 : 멀티 에이전트 게임의 포화 및 오염 저항 벤치마크

인공지능 섬(AGENT ISLAND): 낙관-및 오염 저항성 벤치마크는 멀티 에이전트 게임에서 인공지능 섬은 언어 모델 에이전트가 협력, 충돌 및 설득을 포함한 게임에서 경쟁하는 멀티 플레이어 시뮬레이션 환경입니다. 이 환경은 낙관-및 오염 저항성을 제공하는 동적 벤치마크를 제공하며, 새로운 모델은 언제나 현재 최고의 플레이어를 이기기 때문에 새로운 모델은 항상 현재 최고의 플레이어를 이기고, 에이전트는 고정된 태스크 세트 대신 다른 적응적 에이전트와 경쟁합니다. 우리는 베이즈 네트워크

에이전트 5월 7일

LCM : 손실없는 컨텍스트 관리

LCM: 무손실 컨텍스트 관리 (Lossless Context Management, LCM) arXiv:2605.04050v1 발표 유형: 새로운 abstract 무손실 컨텍스트 관리 (LCM)이라는 determintic 아키텍처를 제시합니다. 이 아키텍처는 대규모 언어 모델(LLM) 메모리에서 Claude Code를 능가하는 성능을 보입니다. Opus 4.6을 사용하여 벤치마크한 LCM-augmented 코딩 에이전트, Volt는 OOLONG long-context eval에서 Claude C

에이전트 5월 7일

에이전트 안전 판단 향상 : 조절 된 벤치마크 재 작성 및 배포 외의 속임수 시나리오에 대한 아날로그 이유

인공지능 요소의 안전한 판단을 높이기 위한 연구: 제어된 벤치마크 재작성 및 유사성 논리 reasoning을 통한 분포 이탈 시의 속임수 시나리오 arXiv:2605.03242v1 발표 유형: 새로운 요약: 대규모 언어 모델(LLM)로 güç을 받는 도구 사용 인공지능 시스템은 웹, 앱, 운영 체제 및 거래 환경에서 점점 더 많이 배포되고 있습니다. 그러나 현재의 안전 벤치마크는 명시적 위험에 중점을 두고 있으므로 모델이 속임수 또는 모호한 경로를 판단할 수 있는 능력을 과대평가할 수 있습니다.

에이전트 5월 7일

cotomi 법: 당신을 바라보며 작업을 자동화하는 법을 배우기

cotomi Act: 사용자가 작업을 하면서 배우는 자동화 기술 cotomi Act는 브라우저 기반의 컴퓨터 사용 에이전트입니다. 이 에이전트는 사용자의 작업을 신뢰할 수 있는 다단계 작업 수행과 지속적인 조직적 지식 학습을 결합한 것입니다. 이 에이전트는 다음의 기술을 사용하여 179-작업 WebArena 인간 평가 집합에서 80.4%의 성능을 달성했습니다. - 적응적 느긋한 관찰 - 단어 차이 기반의 역사 압축 -粗细 계층 구조의 작업 - 테스트 시간에 대한 N 작업 선택 또한 co

LLM PC 5월 7일

ADAPTS : 자동 프로토콜 - 증상 추적을 위한 에이전트 분해

감정 인식에서 부정적인 감정을 표현하는 임상적 추상 개념을 불특정 임상 상호 작용에서 모델링하는 것은 독특한 도전이다. 우리는 ADAPTS(대인적 분해를 위한 증상 추적에 대한 자동화된 프로토콜 무관 Framework, Agentic Decomposition for Automated Protocol-agnostic Tracking of Symptoms)라는 framework를 제시한다. 이 framework는 mixture-of-agents 대규모 언어 모델(LLM) 아키텍처를 사용하여 우울증과

에이전트 5월 7일

Terminus-4B : 더 작은 모델이 Agentic Execution 작업에서 Frontier LLM을 대체 할 수 있습니까?

Terminus-4B: 더 작은 모델이 프론티어 대규모 언어 모델(LLM) 대신 에이전트 실행 작업에서 대체할 수 있을까? 현대 코딩 에이전트는 특화된 서브태스크를 서브에이전트에 위임하는데, 서브에이전트는 좁은 책임을 맡는 더 작은 에이전트 루프이다. 이 아키텍처 패턴은 메인 에이전트의 컨텍스트 창을 깨끗하게 유지하기 위해 verbose 출력(예: 빌드 로그, 테스트 결과 등)을 서브에이전트 컨텍스트 내에 분리한다. 에이전트가 이러한 작업을 위해 서브에이전트를 사용할 때, 일반적으로 프론티어

AI 모델 5월 7일

사례에서 올바른 행동을 배우기 : 자율 에이전트에서 순차적 실행을 검증하기

자율적 에이전트의 순차적 행동을 검증하는 새로운 알고리즘을 제시했다. 이 알고리즘은 2-10개의 성공적인 실행 트레이스를 통해 올바른 행동을 자동으로 학습하고, 학습된 모델에 새로운 실행을 검증한다. 이 알고리즘은 컴파일러 이론의 도미네이터 분석 및 멀티모달 대규모 언어 모델-powered 의미 이해를 결합하여 필수 상태를 식별하고 비결정적 행동을 처리한다. 시스템은 Prefix Tree Acceptors를 사용하여 일반화된 ground truth 모델을 생성하고, traces를 다중 계층 적합성

LLM PC 5월 7일

안정적인 요원 제어 : 자율 사이버 방어를위한 도구 중재 LLM 아키텍처

안정적 행위자 제어: 도구 매개 LLM 아키텍처를 위한 자율적인 사이버 방어 안전한 결정-making을 위한 형식적 보장이 제공되지 않는 고위험 가치에 대한 대응을 필요로 하는 행위자 시스템을 위한 해결책이 필요하다. 보안 운영 센터(SOC)가 공격적인 압력을 받는 동안 끝점 감지 및 반응(EDR) 정책을 구성해야 하는 운영 환경에서 영감을 얻은 우리는 도구 매개 아키텍처를 제시한다: LLM 행위자가 결정론적 도구(스택엘버그 최적 반응, 베이즈 관찰자 업데이트, 공격 그래프 원소)를 사용하고 도

인기 태그