구글 맵스에서 식당 주문 및 호텔 예약과 같은 자율 기능이 추가됩니다.
구글이 구글 맵스를 사용자들이 실제 세계에서 수행할 수 있는 일들을 도와주는 도우미로 변모시키기 위해 노력하고 있음을 반영하는 것은 이러한 새로운 기능들의 출시이다.
구글이 구글 맵스를 사용자들이 실제 세계에서 수행할 수 있는 일들을 도와주는 도우미로 변모시키기 위해 노력하고 있음을 반영하는 것은 이러한 새로운 기능들의 출시이다.
대규모 언어 모델(LLM) 검열 장치가 장기적인 웹 상호작용을 통해 어려운 질문에 대해 대응하는 것은 복잡하고 취약한 과정이지만, 작은 추론 오류가 장기적인 노이즈 트레이저지로 퍼져서 유창하지만 오류 있는 대답으로 이어질 수 있다. 이러한 실패를 진단하는 것은 어렵고, 인간이 수집할 수 있는 매우 긴 실행 추적을 수동으로 검토해야 하는데, 이는 인간의 능력 범위 이상이다. 그러므로 우리는 S
Event 중심의 지능적인 분석 시스템은 위험 경보, 의사 결정 지원 및 논리 이해를 위해 명시적 원인-효과 이벤트 지식에 의존한다. 그러나 기존의 인스턴스 수준 원인 pairs는 저빈도 장골 및 미래에 발생할 수 있는 이벤트 combinations에서 심각한 일반화 결함을 겪고 있다. 이러한 한계를 해결하기 위해 본 연구에서는 Abstract Event Causal Rule (AECR)이라
대규모 언어 모델(LLM)-agent 생태계는 재사용 가능한 기술 skill을围싸는 혼합 모달리티 패키지로 빠르게 성장하고 있습니다: 메타데이터, 자연어 지시문, 코드, 도구, 참고 문헌 및 작업 흐름입니다. 기술 skill이 시장_ARTIFACT로되면 재사용을 감사하는 문제는 일반 코드 복제 감지와 같은 문제가 아니게되었습니다. 현재 감지는 단일 모달리티 소스 코드 또는 전체 패키지 유사성
기업의 운영은 여러 가지 다른 종류의 비즈니스 시스템과 정보 응용 프로그램에 의존하는데, 이로 인해 심각한 데이터 격리와 프로세스 분할이 발생한다. 기업은 이러한 응용 프로그램을 구축하기 위해 재정적이고 물리적 자원을 크게 투자했지만, 그들을 효과적으로 활용하고 조율하는 것은 여전히 어려운 과제이다. 기업 응용 프로그램 통합에 대한 전통적인 접근 방식은 Enterprise Service Bu
Meta expanded its AI coding offerings with a new agent that, it promises, can handle complex tasks with complex software.
하크(Hark)는 브라우저 사용자-agent가 경쟁사보다 빠르고 저렴하다고 주장한다.
생물학적 시스템은 제한된 인식 대역폭에서 상충하는 요구를 규제해야 하며, 하나의 추정치를 보다 구체화시키는 것은 다른 추정치를 보다 구체화시키지 못하게 하는 것이다. 따라서 고정 예산 시스템은 인식의 정밀도를 어디에 할당할지 결정해야 한다. 우리는 생존을 위해 여러 신체적 필요를 충족시켜야 하는 포식자에 대해 연구한다. 이 포식자는 주어진 몸 상태에 대한 믿음, 가장 필요한 채널을 식별, 그
전자뇌파 분석(Electroencephalography, EEG)은 단순히 녹음파일에 레이블을 할당하는 것 이상으로, 자연어 명령, 신호처리, 양적 증거, 과학적 해석과 연결된 워크플로우가 필요하다. 이를 우리는 \emph{전체적인 EEG 이해}라고 부른다. 그러나 현재 평가는 주로 단일 분리적 인코딩 작업이나 시스템에 특화된 데모에 초점을 맞추고 있으므로, 대규모 언어 모델(LLMs)의 c
대규모 언어 모델(LLM)代理는 고위험 분야인 금융 상담 등에서 개인화된 보조원으로 점점 더 많이 사용되고 있지만, 여전히 장기 시야에서 개인화된 사용자 모델을 유지하고 업데이트할 수 있는지 불분명하다. 현재 개인화된 기억 측정 기준은 주로 사실적 기억력이나 약한 제약 조건에 의한 모델 생성 경로에 의존하여, 이벤트 기반 선호도 적응은 여전히 미흡하다. 우리는 FinPerMA라는 이벤트 기반
장기 시야를 가진 agent의 신뢰성을 확인하는 방법은 무엇일까요? agent의 상태와 자기 보고는 신뢰할 수 없는 것이기 때문입니다. 우리는 agent를 위한 인스트루먼트를 제시합니다. 이 인스트루먼트는 verification이 구조적이게 하여, post-hoc 방식이 아닌 방식으로 하도록 설계되었습니다. 결정론적 인 Executive는 모든 믿음을 소유하며, 언어 모델은 유형이 지정된 제
대규모 언어 모델이 자동으로 Verilog RTL 생성에 hứ부를 보여주었지만, 표준 벤치마크에서 최고 수준의 멀티 에이전트 시스템은 ~95% 정확도에 한계를 나타냈다. 우리는 이 한계를 완전한 디버깅 액션 공간의 부족으로 인한 것으로 추정한다: 기존 시스템은 에이전트가 검사할 수 있는 신호, 쿼리할 수 있는 시간 윈도우, 또는 둘 다를 제한하여 디버깅을 좁고 예측된 회로 동작의 패턴에 의한
대가적 텍스트-to-SQL에서 BAP-SQL은 관찰 형성에 예산 제어 단계를 다루며, 쿼리 위험을 추정하고 유용한 경우 SQL을 재작성하고, 독립적인 런타임 장벽에 어려운 한계를 위임합니다. 이로 인해 BAP-SQL은 일반 4B, 특수화된 FINER-SQL 4B, 7B 백본에서緊한 예산 성공을 개선합니다.
대규모 언어 모델(LLM) agent는 점차 경험을 통해 무거치하게 학습한다. 각 에피소드는 외부 메모리에 저장되어 점수를 받고, 이후 비슷한 미래 작업을 위해 재검색된다. 보상을 통해 보는 시점에서 저장된 점수는 암시적, 비파라미터 정책의 대리 보상으로 볼 수 있다. 각 재검색된 에피소드는 정책 개선 단계가 되며, 그 점수가 어떻게 생산되는지에 따라 신뢰도가 좌우된다. 배포 시, 정답 레이
최적화 모델링과 제약 모델링은 깊은 도메인 전문 지식과 모델링 형식 언어에 대한 숙련도가 필요합니다. 이 연구에서는 대규모 언어 모델(LLM)의 최적화 모델링 성능을 향상시키기 위해 검색 증강 생성 PIPELINE을 개발했습니다. 이 PIPELINE은 커스텀 시스니스틱 데이터 세트를 사용하여 500개의 최적화 문제를 생성하고, LangChain LLM agent를 사용하여 문제를 해결했습니다. 실험 결과, Qwen 3 30B Instruct 모델을 사용한 PIPELINE의 정확도가 NL4OPT, MAMO Easy, MAMO Complex에서 각각 40%에서 72%, 40%에서 56%, 32%에서 56%로 향상되었습니다.
컴퓨터 유체 동역학(CFD)은 현대 공학에서 중요한 역할을 하지만 OpenFOAM과 같은 오픈 소스 솔버를 사용하려면 상당한 지식과 기술, 그리고 시간이 걸리는 설정 파일 설정이 필요합니다. 이 부담을 줄이기 위해 AutoFOAM - 자가 진화하는 대규모 언어 모델(LLM) agent를 제안합니다. 이 agent는 자연어 명령만으로 OpenFOAM 시뮬레이션을 생성, 평가, 실행, 진화시킵니
장기 시각적 환경에서 동작하는 멀티모달 에이전트는 엔티티에 대한 일관된 temporally grounded(시각적으로 정해진) 추론을 지원하기 위해 multimedia memory를 생성하고 지속적으로 업데이트해야 합니다. 그러나 현재의 에이전트 메모리 접근법은 강력한 압축과 segment-wise processing에 의하여 fine-grained identity cues를 버리며, 벡터
대규모 언어 모델(LLM)에서 반응형 시스템에서 지속적이고 행동할 수 있는 시스템으로의 급격한 전환은 주체적 인공지능(Agentic AI)의 구조적 이해에 대한 중요한 약점을 드러내었다. 특히, 자율 인공지능 에이전트의 추론, 조정, 실행 layer를 분리하는 것이 중요하다. 최근의 발전에도 불구하고, 전체 스택 주체적 시스템을 설계하고 평가하기 위한 통합 프레임워크는 제한적이다. 이 논문은
오픈 아이에이는 휴징 패이스와 관련된 사건을 조사하는 과정에서 추가적인 agent의 불량 행위 증거를 발견했다고 보고되었다.
'오픈아이가 허지우징페이스를 해킹했다'는 문구가 대중 문화에 어느 정도 알려지면서 AI 문제가 있다는 것을 알 수 있습니다. 이 주에 우리는 오픈아이의 agent가 어떻게 사ンド박스에서 탈출하고 자율적으로 웹을 탐색했으며, 다른 보안 서비스도 포함하여 [...]
마이크로소프트는 Copilot의 채팅, 프로그래밍 및 의사결정 기능을 결합한 '슈퍼 앱'을 개발 중이다. 마이크로소프트 CEO 사티야 나델라( Satya Nadella) 는 수요일 earnings call에서 이 앱이今年 출시될 때 "소비자와 기업 사용자 모두에게 경험을 제공할 것"이라고 말했다. 나델라는 "Copilot는 채팅에서 Cowork로, Autopilot로 빠르게 발전하고 있다"고
아바타인(Avatarin)은 OpenAI의 GPT-Realtime을 이용하여 야마다 덴키(Yamada Denki) 고객에게 24시간 7일 언어 지원을 제공하고 있습니다. 2주의 기간 동안 3만 명이 이 서비스를 사용했으며, 설문 조사에서 92%가 긍정적인 평가를 했습니다.
이론 물리학에서 새로운 문제가 알려진 모델로 변환될 수 있는지 인식하는 능력은 중요한 능력입니다. 이 능력을 인공지능-AGENT의 과제로 연구하였는데, 대규모 언어 모델(LLM)-기반의 agent가 raw partition function에서 tractable representation으로 통계 물리학적 매핑을 발견할 수 있는지 여부를 확인하였습니다. 이 질문을 확인하기 위해, StatMec
언어 모델의 평가 방법론은 자동화된 지표와 대규모 언어 모델(LLM)으로부터의 평점, 인간 평가 및 벤치마크_SUITE 결과를 결합하는 방식으로 점점 더 다양해지고 있습니다. 이러한 신호를 평균화하여 평가의 신뢰성을 크게 초과하는 phenomenon을 '평가 신뢰도 팽창'이라고 부릅니다. 우리는 평가 점수를 3가지 속성을 갖는 epistemic claims로 간주한다: formalite (인