메멘토: 유형식 의미 기억과 정보 이론적 검색을 위한 장기 수명 에이전트
메멘토는 대규모 언어 모델(LLM) 기반의 에이전트 시스템에서 기억을 개선하기 위한 새로운 메모리 계층을 제안합니다. 메멘토는 유형식 의미 기억 스키마, 자동 충돌 해결 기구, 시간 버전 관리를 포함하고 있습니다. 이 시스템은 Moorcheh의 정보 이론적 검색 엔진을 사용하여 빠른 검색 속도와 낮은 연산 복잡도를 제공합니다.
전체 기사
메멘토는 대규모 언어 모델(LLM) 기반의 에이전트 시스템에서 기억을 개선하기 위한 새로운 메모리 계층을 제안합니다. 메멘토는 유형식 의미 기억 스키마, 자동 충돌 해결 기구, 시간 버전 관리를 포함하고 있습니다. 이 시스템은 Moorcheh의 정보 이론적 검색 엔진을 사용하여 빠른 검색 속도와 낮은 연산 복잡도를 제공합니다.
대규모 언어 모델(LLM) 기반의 에이전트가 과학 데이터 분석을 자동화하고, 과학적 발견을 가속화하는 것으로 보이지만, 이는 또한 가짜 분석의 급속한 생산을 가속화하는 것일 수 있다. 이러한 분석은 선택적으로 선택된 분석을 통해 지원되는 가설 공간을 후보 주장으로 변환할 수 있다. 과학적 지식은 코드의 반복적 축적과 후속 통계적 지원으로 검증되지 않는다. 따라서 에이전트의 도움으로 생성된 비 실험적 주장의 진실성을 평가하기 위해 적대적 실험의 기준을 제안한다.
AI 연구 파이프라인이 점점 더 많은 학술 연구 결과를 생산하고 있습니다. 그러나 이러한 연구 결과는 기존의 피어 리뷰 기준을 충족하는 품질과 새로운 점을 가지고 있습니다. 그러나 출판 시스템은 모든 인간 저자에 대한 UNIVERSAL ASSUMPTION을 가정하고, 자동화된 파이프라인을 통해 생성된 지식의 신뢰성을 평가하는 원칙적인 방법이 없습니다. 이러한 문제를 해결하기 위해, 이 연구는 두 가지 계층 인증 프레임워크를 제안합니다. 이 프레임워크는 지식의 품질 평가와 인간의 기여도를 평가하는 두 가지 별개의 계층으로 나누어, 출판 시스템이 파이프라인으로 생성된 연구 결과를 일관되게 및 투명하게 처리할 수 있습니다.
지금까지 대규모 언어 모델(LLM) 에이전트를 사용하여 데이터와 코드에 접근할 수 있는 사회과학 결과를 재생산하는 연구가 있었다. 하지만 만약에 논문에만 있는 방법 설명과 원래 데이터만 주어졌을 때, LLM 에이전트가 결과를 재생산할 수 있는지 궁금했다. 이 연구에서는 논문에서 구조화된 방법 설명을 추출하고, 원래 코드, 결과, 논문을 에이전트가 절대 보지 못하는 정보 분리 하에 리IMPLEMENT에이션을 실행하는 자기적 재생산 시스템을 개발했다. 또한, 에이전트가 재생산한 결과와 원래 결과를 셀 수준으로 비교하고, 불일치의 원인을 추적할 수 있는 오류 분포를 위한 단계를 추가했다. 4개의 에이전트 scaffold와 4개의 LLM를 48개의 논문에 대해 인간이 검증한 재생산 가능성을 평가한 결과, 에이전트가 largley 원래 결과를 재생산할 수 있지만, 모델, scaffold, 논문에 따라 성능이 크게 차이가 난다는 것을 발견했다. 불일치의 원인을 분석한 결과, 에이전트의 오류와 논문 자체의 미분명함이 실패의 원인이라는 것을 밝혔다.
약물 분자 평가, 검출 및 최적화라는 복잡한 워크플로우를 처리하기 위해 여러 도구를 조정해야 하는 컴퓨터 약물 발견에서 AI 에이전트가 장기적으로 안정적인 성능을 유지하고 고급 복잡성 시나리오에서 일관되게 성능이 좋지 않다는 문제가 있습니다. MolClaw는 약물 분자 평가, 검출 및 최적화에 대한 자동화된 에이전트를 제시합니다. MolClaw는 30개 이상의 도메인 리소스를 통합하는 3단계 계층적 스킬 아키텍처(총 70개 스킬)가 있어 에이전트가 런타임에 장기적으로 상호 작용할 수 있습니다.
의료 영상 처리 연구는 실질적인 임상 배포로 전환하고 있는 추세입니다. 이러한 환경에서 분석 방법은 모델 설계를 넘어 데이터셋에 대한 워크플로 구성 및 증명성 추적을 필요로 합니다. 따라서 adaptability(가변성)과 reproducibility(재현성)라는 두 가지 요구 사항이 중심이 됩니다. 본 연구에서는 의료 영상 처리를 위한 도구 기반 에이전트 프레임워크를 제시합니다. 이 프레임워크는 의료 영상 처리에 대한 의미 있는 계층을 추가하여, artifact contract를 통해 중간 및 최종 출력을 공식화하고, 워크플로 상태 및 목적 조건에 따라 모듈러 규칙 라이브러리를 조합하여 구성할 수 있습니다.
대규모 언어 모델(LLM)은 수학적 벤치마크에서 놀라운 능력을 보여주지만, 이는 실제 수학적 사고인가 아니면 통계적 패턴 매칭인가에 대한 의문이 남아있다. 기존의 평가 방법은 기존 수학적 관습에 기반한 기호 문제에만 의존하여, 모델의 추상 개념을 첫 번째 원칙에서부터 구축할 수 있는 능력을 파악하기 어렵다. 이 연구에서는 '수학이 두 번 필요하다'라는 새로운 벤치마크를 제안하여, 통신을 통해 수학적 사고가 출현하는지 테스트한다. 인간의 수학적 인식이 정교한 통신의 필요성과 함께 진화했을 것이라는 가설에 의해 мот이브 되며, 두 대상을 포함하여, 이전에 수학적 지식이 없던 두 대원이 시각적으로 기반한 작업을 해결하는 데 수학적 언어를 사용하는 데 도움이 되는 수학적 시스템을 발견할 수 있는지 테스트한다. 기존의 데이터셋과는 달리, 우리의 벤치마크는 미리 정의된 수학적 언어를 배제하고 대신에, 이전에 발견하지 못한 구조와 표현을 발견할 수 있도록 한다. '수학이 두 번 필요하다'는 수학적 사고가 출현하는지 테스트하는 새로운 방법을 제공하여, 대규모 언어 모델(LLM)이나 다른 모델의 수학적 사고 능력을 개발하고 평가하는 데 도움이 될 것이다.
산프란시스코 남쪽 북쪽에 위치한 밀밸리(Mill Valley)에 있는 13만 제곱미터의 부동산을 구매하려면 Anthropic 자산이 필요합니다.
인공지능 연구소 Anthropic은 에이전트간 상거래를 위한 시험시장소를 만들었다. 최근 Anthropic은 에이전트가 모두 구매자와 판매자로 나타난 분류형 시장소를 만들고, 실제 물건과 실제 돈을 사용해 진짜 거래를 체결했다.
메인 주지사는 데이터 센터 금지령에 반대했다. L.D. 307은 전국 최초의 데이터 센터 신설 금지령을 제정하려 했는데, 이 경우는 2027년 11월 1일까지 지속되었다.
애플의 새 CEO인 존 툰스는 하드웨어 전문가로 알려져 있으며, 애플이 장치 중심의 전략을 callee할 가능성이 높아졌다. 툰스는 애플의 하드웨어 개발과 디자인에 깊은 이해를 가지고 있으며, 애플의 제품에 대한 열정적인 팬이다.
도쿄는 2026년 가장 중요한 기술 목적지입니다. SusHi Tech Tokyo 2026은 4개의 정의된 기술 영역을 제공하며, 실제로 빌딩하고 펀딩하는 이 기술들을 전 세계적으로 지원합니다. 이 기술들은 대규모 언어 모델(LLM), 인공지능(AI), 차량 자동 주행(V2X), 5G 네트워크 등입니다.