나비다가 개발한 인공지능 로봇이 자체적으로 마더보드에 GPU를 설치하는 방법을 배우는 모습
엔비디아는 PC 조립과 같은 정밀하고 섬세한 작업을 실세계에서 스스로 배우는 지적 행위 봇을 선보였다.
961개의 기사
엔비디아는 PC 조립과 같은 정밀하고 섬세한 작업을 실세계에서 스스로 배우는 지적 행위 봇을 선보였다.
허그킹 페이스 허브에서부터 로봇 하드웨어까지, Strands Agents와 LeRobot은 인공지능(AI) 기술의 발전을 증명했다. 이 두 회사간의 협력은 인공지능(AI) 기술을 로봇 하드웨어에 적용하는 데 큰 발전을 가져왔다.
arXiv:2606.17459v1 Announce Type: new Abstract: Evaluating the decision-making capabilities of large language models (LLMs) is a growing research priority, yet existing benchmarks focus on isolated co
arXiv:2606.17454v1 Announce Type: new Abstract: AI agent performance is not just a modeling problem, it is fundamentally a systems problem. The advanced capabilities of models are realized through age
대규모 언어 모델 에이전트가 점차적으로 지도 서비스에 통합되고 있습니다. 지도 서비스는 일상 생활 시나리오에 비해 전문적인 업무 환경에 통합되지 않기 때문에 사용자는 종종 사용자의 필요를 구체적으로 표현하지 못하고, 명시적으로 표현하지 못한 여러 가지 필요, 즉 암묵적 결정 요소들을 포함하는 미분명한 질의를 내놓습니다. 이러한 문제를 해결하는 가장 효과적인 방법은 사용자와의 대화에서 명확성을
대규모 언어 모델(LLM)은 대화 협력자에서 자율적이면서 목표를 이해하고 행동을 계획하고 도구를 호출하고 다단계 작업을 수행하는 자율적 인 agent로의 전환을 촉진했습니다. 그러나 단일 agent의 능력은 지역 데이터, 도구 허가, 실행 환경 및 통치 경계에 의해 제한됩니다. 이 논문은 분산 일반-purpose agent 네트워크를 연구합니다: 개방형 peer-to-peer 네트워크에서 개
대규모 언어 모델(LLM) 에이전트는 점차적으로 사용자의 정보를 여러 세션 동안 유지하는 장기 기억력을 유지하고 있습니다. 그러나 일반적으로 이러한 기억력은 질문 행이나 에피소드의 정확도 합계로 평가됩니다. 그러나 이 방법은 여러 질문이 동일한 사실을 조사하는 경우에도 각 질문 행을独立으로 평가하므로, 그 사실이 조건이 달라짐에 따라 어떻게 행동하는지 보여주지 못합니다. 우리는 MemTrac
법률 문서 검색은 법률 용어의 복잡성과 쿼리와 관련된 문서 간의 정확한 단어 대응이 필요한데다 어려움을 겪고 있습니다. although dense retrieval models는 눈에 띄는 진전을 이루었지만, 실증 연구 결과 BM25는 여전히 이 영역에서 강력한 기준선으로 기능하고 있습니다. 그러므로 BM25를 parameter training없이 향상시키는 rule-driven query
인공지능이 목표를 달성하기 위해 필요한 과정을 수시로 반복하는 '대화식 탐색'에서, 목표 달성을 위한 과정을 더 많이 반복하거나 더 많은 과정을 동시에 진행하는 두 가지 방법 중 하나를 선택하여 과정을 더 빠르게 진행하는 '시간당 확대'를 연구했다. 이번 연구에서는 '동시 탐색' 방법에 집중하였으며, 일반적인 동시 샘플링 방법은 성능이 점차적으로 저하되는 것을 발견하였다. 이는 첫 번째 질문
말레이시아의 스타트업 Respond.io는 고객 문의를 처리하는 대량의 AI agent를 사용하고, 대화당 비용을 청구하는 혁신적인 모델을 구현했습니다. 이 회사는 인수 목표를 향해 6.25억 달러를 모금했습니다.
실세계 배포에서는 시간 시리즈 데이터가 극도로 불규칙합니다. 관측치는 비동기적이며, 누락된 값은 무작위가 아닌 정보가 풍부한 값이며, 센서 및 작동 창구별로 샘플링 빈도는 다릅니다. 그러나 기존의 시간 시리즈 질의 응답(TSQA) 벤치마크는 대개 정칙적으로 샘플링된 입력을 가정합니다. 이는 대규모 언어 모델(LLMs)과 인공지능 agent가 불규칙한 조건 하에서 성능을 어떻게 발휘하는지에 대
인공지능(AI)을 대용품으로 사용하는 대신에 원리 기반 지성(cognitive capital)을 보완하는 대신에 사용하는 경우, 지성 부채(cognitive debt)가 쌓이게 됩니다. 이 지성 부채는 시스템의 약점을 증가시키는 데 기여합니다.
우리는 cloud-based 지리 공간 카탈로그에서 자연어 쿼리 사용하여遠距離 센싱 데이터를 검색하는 LLM 구동 프레임워크를 제시합니다. 시스템은 사용자의 의도를 구조화된 API 호출로 변환하여卫星 사진과 환경 데이터에 효율적인 접근을 허용합니다. 아키텍처는 세 가지 agent를 통합합니다: 안전성과 정책 집행을 위한 Guardrail, 의도 해석을 위한 General-QA, schema-
컴퓨터 사용을 위한 agent의 평가가 점점 더 현실적인 데스크톱과 웹 작업을 완수하는지 여부로 이루어지고 있습니다. 그러나 작업의 성공만으로는 agent가 안전하지 않은 단축 경로를 통해 목표를 달성하는 실패를 놓치게 됩니다. 우리는 OSGuard라는 안전성을 평가하는 데 사용되는 컴퓨터 사용 agent의 이중 granular benchmark suite를 소개합니다. OSGuard는 사용
프론티어(_frontier) 논리 reasoning-tuned 언어 모델은 깊은 deductive 작업에서 실패하고, 내부 reasoning을 확장하여 성능을 개선하는 비용은 좋지 않다. Symbolic delegation은 논리 프로그래밍의 자동 formalization pipe line을 통해 문제를 번역하고, 해결기를 통해 추론을 수행하는 보완적인 경로를 제공한다. 그러나 현재 논리 프
AI-agent 간의 신뢰를 측정하는 새로운 방법을 제안했습니다. 이 방법은 팀워크를 위한 언어 모델 agent 간의 신뢰 형성, 파괴, 회복을 연구했습니다. 결과적으로 신뢰 형성은 팀워크의 성능을 향상시키지만, 파괴는 팀워크의 성능을 저하시킵니다.
대규모 언어 모델(LLM)을 위한 에이전트 검색은 스케일러블한 후보물질 발견을 위한 리트리버 매개 인터페이스(예: BM25 또는 ColBERT)를 사용합니다. 이러한 인터페이스는 관련 문서를_ranking하는 데 효과적이지만, 에이전트가 문서 간에 제약을 확인하고 재조직하는 능력을 제한하는 ranked 결과 또는 bounded 문서 뷰만 제공합니다. 문서 간 제약 확인과 재조직을 위한 Dir
기업 보안의 다음 도전은 인사 관리가 아니라 AI 에이전트 관리가 될 것이라고 NewCore가 주장한다. AI 에이전트는 점점 더 많은 역할을 맡고 있으며, 이를 관리하는 새로운 방법이 필요하다.
Salesforce는 Fin 팀과 기술을 사용하여 기존의 기업 플랫폼인 Agentforce를 개선하겠다고 밝혔다. 이 플랫폼은 기업들이 커스터마이즈 가능한 AI agent를 사용하여 업무를 자동화할 수 있도록 도와준다.
arXiv:2606.13884v1 Announce Type: new Abstract: Modern decision systems increasingly rely on learned components whose outputs may be confident yet wrong, exposing downstream actions to costly errors.
사업 지능(BI)은 최근 대규모 언어 모델(LLM) 기반 지원과 대시보드 상호 작용을 결합하고 있지만, 다단계 분석 시 두 가지 모드가 동기화되지 않아 어려움을 겪고 있다. 사용자가 직접 대시보드 조작과 자연어 질의 사이에서-switch 할 때, 필터, 계층, 지표, 차트 콘텍스트와 같은 분석적 상태를 일관성 있게 유지하는 것이 어려워진다. 우리는 두 가지 모드를 동시에 사용하는 동안 일관성
YeasierAgent는 사용자,-agent, 세계 간 협력적인 공간으로의 애플리케이션을 재정의하는 새로운 소프트웨어 모델을 제시합니다. 이 모델은 사용자와-agent 간의 상호 작용을 통해 플랫폼에 구애받지 않는 상호 작용적 앱을 빠르게 구축할 수 있습니다.
arXiv:2606.13715v1 발표 종류: 새로운 논문 요약 2024년 3월 WorkBench에서 가장 뛰어난 agent는 GPT-4였으며, 그 중 43%를 완료하고 26%에서 의도하지 않은 해로운 행동을 취했습니다(예를 들어, 잘못된 사람에게 이메일을 보냈습니다). 2026년 6월에 이 벤치마크를 다시 방문했을 때, 현재까지 가장 뛰어난 agent인 Claude Opus 4.8은 89%
인공지능이 실제 세계에서 일반 인공지능을 달성하기 위해 수행하는 facto 작업으로는 심층 연구와 agent의 진화가 있습니다. 심층 연구는 개방된 환경에서 개방된 연구 작업을 해결하기 위해 정보의 자율적 수집과 통합을 허용하는 반면, agent 시스템의 정적 매개변수 심층 연구 능력에 의해 제한됩니다. 다른 한편으로, agent는 환경과 자율적으로 상호 작용하여 경험을 얻어 모델 능력을 진