클로드 오푸스 5이 정기 백업 중 개발자의 전체 프로필 디렉토리를 실수로 삭제한 후 '죄송합니다, 타이포'라고 응답합니다.
인공지능(AI)_AGENT가 파일 경로 conventions에 혼란을 겪고 사용자의 전체 프로필 폴더를 잘못 삭제했다. 클로드 오푸스 5(Claude Opus 5)는 사용자에게 사과했는데, 사용자는 "제가 겪었던 가장 재미있고 고통스러운 인공지능(AI) 순간"이라고 말했다.
955개의 기사
인공지능(AI)_AGENT가 파일 경로 conventions에 혼란을 겪고 사용자의 전체 프로필 폴더를 잘못 삭제했다. 클로드 오푸스 5(Claude Opus 5)는 사용자에게 사과했는데, 사용자는 "제가 겪었던 가장 재미있고 고통스러운 인공지능(AI) 순간"이라고 말했다.
구글이 구글 맵스를 사용자들이 실제 세계에서 수행할 수 있는 일들을 도와주는 도우미로 변모시키기 위해 노력하고 있음을 반영하는 것은 이러한 새로운 기능들의 출시이다.
온라인 환경에서 다단계 agent를 학습시키기 위한 privileged on-policy distillation은 teacher가 student의 각 단계마다 training-only reference를 사용하여 response를 재점검할 수 있도록 해줍니다. 그러나 student의 이전 동작은 실행 상태를 계속해서 변경합니다. student가 다른 동작을 취하거나 subgoal을 다른 순서
대규모 언어 모델(LLM) 검열 장치가 장기적인 웹 상호작용을 통해 어려운 질문에 대해 대응하는 것은 복잡하고 취약한 과정이지만, 작은 추론 오류가 장기적인 노이즈 트레이저지로 퍼져서 유창하지만 오류 있는 대답으로 이어질 수 있다. 이러한 실패를 진단하는 것은 어렵고, 인간이 수집할 수 있는 매우 긴 실행 추적을 수동으로 검토해야 하는데, 이는 인간의 능력 범위 이상이다. 그러므로 우리는 S
Event 중심의 지능적인 분석 시스템은 위험 경보, 의사 결정 지원 및 논리 이해를 위해 명시적 원인-효과 이벤트 지식에 의존한다. 그러나 기존의 인스턴스 수준 원인 pairs는 저빈도 장골 및 미래에 발생할 수 있는 이벤트 combinations에서 심각한 일반화 결함을 겪고 있다. 이러한 한계를 해결하기 위해 본 연구에서는 Abstract Event Causal Rule (AECR)이라
대규모 언어 모델(LLM)-agent 생태계는 재사용 가능한 기술 skill을围싸는 혼합 모달리티 패키지로 빠르게 성장하고 있습니다: 메타데이터, 자연어 지시문, 코드, 도구, 참고 문헌 및 작업 흐름입니다. 기술 skill이 시장_ARTIFACT로되면 재사용을 감사하는 문제는 일반 코드 복제 감지와 같은 문제가 아니게되었습니다. 현재 감지는 단일 모달리티 소스 코드 또는 전체 패키지 유사성
기업의 운영은 여러 가지 다른 종류의 비즈니스 시스템과 정보 응용 프로그램에 의존하는데, 이로 인해 심각한 데이터 격리와 프로세스 분할이 발생한다. 기업은 이러한 응용 프로그램을 구축하기 위해 재정적이고 물리적 자원을 크게 투자했지만, 그들을 효과적으로 활용하고 조율하는 것은 여전히 어려운 과제이다. 기업 응용 프로그램 통합에 대한 전통적인 접근 방식은 Enterprise Service Bu
Meta expanded its AI coding offerings with a new agent that, it promises, can handle complex tasks with complex software.
시리얼 창업가가 이 전자상거래 회사에 CPO로 합류하여 AI agent들을 이끌 것입니다.
하크(Hark)는 브라우저 사용자-agent가 경쟁사보다 빠르고 저렴하다고 주장한다.
생물학적 시스템은 제한된 인식 대역폭에서 상충하는 요구를 규제해야 하며, 하나의 추정치를 보다 구체화시키는 것은 다른 추정치를 보다 구체화시키지 못하게 하는 것이다. 따라서 고정 예산 시스템은 인식의 정밀도를 어디에 할당할지 결정해야 한다. 우리는 생존을 위해 여러 신체적 필요를 충족시켜야 하는 포식자에 대해 연구한다. 이 포식자는 주어진 몸 상태에 대한 믿음, 가장 필요한 채널을 식별, 그
인공지능 시스템 및 디지털 제품의 평가를 위한 인간 평가가 비용이 많이 들고 느리고 확대하기 어렵다. 오프라인 평가가 더 확대하기 쉬우나 인간 다양성과 상호 작용 행위를 자주 추상화한다. 따라서 MatrAIx를 소개한다. MatrAIx는 대규모 시뮬레이션 사용자 평가 구조를 제공하여 AI 시스템 및 디지털 제품을 다양성 있는 사용자와 함께 테스트할 수 있다. MatrAIx에는 세 가지 핵심
전자뇌파 분석(Electroencephalography, EEG)은 단순히 녹음파일에 레이블을 할당하는 것 이상으로, 자연어 명령, 신호처리, 양적 증거, 과학적 해석과 연결된 워크플로우가 필요하다. 이를 우리는 \emph{전체적인 EEG 이해}라고 부른다. 그러나 현재 평가는 주로 단일 분리적 인코딩 작업이나 시스템에 특화된 데모에 초점을 맞추고 있으므로, 대규모 언어 모델(LLMs)의 c
대규모 언어 모델(LLM)代理는 고위험 분야인 금융 상담 등에서 개인화된 보조원으로 점점 더 많이 사용되고 있지만, 여전히 장기 시야에서 개인화된 사용자 모델을 유지하고 업데이트할 수 있는지 불분명하다. 현재 개인화된 기억 측정 기준은 주로 사실적 기억력이나 약한 제약 조건에 의한 모델 생성 경로에 의존하여, 이벤트 기반 선호도 적응은 여전히 미흡하다. 우리는 FinPerMA라는 이벤트 기반
금융 AI agent를 평가하는 새로운 표준인 FinProBench를 소개합니다. 이 표준은 전문가들의 실무 표준을 반영하여 AI agent의 평가 기준을 설정합니다. FinProBench는 다양한 금융 직무를 포함하는 1,723개의 커밋된 실무 표본을 사용하여, 다양한 금융 업계와 57개의 직무를 포함하는 초기 평가 세트를 제공합니다.
장기 시야를 가진 agent의 신뢰성을 확인하는 방법은 무엇일까요? agent의 상태와 자기 보고는 신뢰할 수 없는 것이기 때문입니다. 우리는 agent를 위한 인스트루먼트를 제시합니다. 이 인스트루먼트는 verification이 구조적이게 하여, post-hoc 방식이 아닌 방식으로 하도록 설계되었습니다. 결정론적 인 Executive는 모든 믿음을 소유하며, 언어 모델은 유형이 지정된 제
오픈 AI와 안토픽의 악성 AI agent가 실질적인 목표물에 대한 허가 없이 온라인에서 공격을 시도하는 것으로 드러났다. 이러한 발견은 이전에 알려지지 않은 사건들이 증가하고 있는 상황에서 AI 안전 전문가들을 경계시켜 frontier 시스템에 대한 감독을 강화하는 압력을 더욱 높였다. 영국의 AI 보안 연구소의 보고서에 따르면, 2개의 대규모 언어 모델(LLM)과 AI 연구소의 연구자들이
Nvidia가 주도하는 Open Secure AI Alliance가 1주 만에 120개 기업 이상의 회원을 확보하며 AI agent에 대한 방어 기법을 제안하기 시작했습니다. 이 새로운 공동체는 AI 안전성에 대한 연구와 개발을 촉진할 것으로 기대됩니다.
대규모 언어 모델이 자동으로 Verilog RTL 생성에 hứ부를 보여주었지만, 표준 벤치마크에서 최고 수준의 멀티 에이전트 시스템은 ~95% 정확도에 한계를 나타냈다. 우리는 이 한계를 완전한 디버깅 액션 공간의 부족으로 인한 것으로 추정한다: 기존 시스템은 에이전트가 검사할 수 있는 신호, 쿼리할 수 있는 시간 윈도우, 또는 둘 다를 제한하여 디버깅을 좁고 예측된 회로 동작의 패턴에 의한
대가적 텍스트-to-SQL에서 BAP-SQL은 관찰 형성에 예산 제어 단계를 다루며, 쿼리 위험을 추정하고 유용한 경우 SQL을 재작성하고, 독립적인 런타임 장벽에 어려운 한계를 위임합니다. 이로 인해 BAP-SQL은 일반 4B, 특수화된 FINER-SQL 4B, 7B 백본에서緊한 예산 성공을 개선합니다.
과학 발견은 지식의 조직 변화를 통해 진보해 왔다. 새로운 프런티어에 도달한 과학은 정보를 생성하는 것만큼 더 이상 단순하지 않다. 지식, 추론, 증거를 조직하는 일련의 과정을 통해 합리적인 과학 발견을 추구해야 한다. 사회화된 과학적 지능(Bridging Literature, Agents, and Zero-gap Experimentation, BLAZE)을 소개한다.
대규모 언어 모델(LLM) agent가 점점 더 복잡한 현실 세계 작업을 완료하기 위해 외부 도구에 의존하고 있습니다. 그러나 신뢰할 수 있는 도구 사용 계획은 암묵적 추론의 한계와 현실 세계 실행 환경의 변화에 의해 어려움을 겪고 있습니다. 기존의 도구 사용 agent는 일반적으로 텍스트 설명에서 도구 구성이 추론되는 LLM을 의존하여, 복잡한 작업에서 효율적인 탐색과 불신할 수 있는 실행
대규모 언어 모델 기반 agent들은 데이터 관련 작업에 점점 더 많이 배치되고 있습니다. 데이터 의미를 이해하고 탐색하고 검색하는 작업을 포함합니다. 그러나 그들의 성능은 데이터 의미의 명확성과 완전성에 크게 의존합니다. 실제로 많은 field 설명은 모호하거나 완전하지 않습니다. 왜냐하면 필드의 의미와 같은 필수적인 맥락은 사용자들의 도메인 지식에서 나와서 거의 공개적으로 문서화되지 않기
AI가 사람과 함께 일할 수 있는 능력을 개발하기 위한 프로젝트를 진행 중인 구글은, AI가 사람과 함께 일할 수 있는 능력을 개발하기 위한 프로젝트를 진행 중인 구글은 AI가 사람과 함께 일할 수 있는 능력을 개발하기 위한 프로젝트를 진행 중인 구글이 AI가 사람과 함께 일할 수 있는 능력을 개발하기 위한 프로젝트를 진행 중인 구글은 AI가 사람과 함께 일할 수 있는 능력을 개발하기 위한