본문으로 건너뛰기

검색

전체 기사

에이전트 4월 27일

메멘토: 유형식 의미 기억과 정보 이론적 검색을 위한 장기 수명 에이전트

메멘토는 대규모 언어 모델(LLM) 기반의 에이전트 시스템에서 기억을 개선하기 위한 새로운 메모리 계층을 제안합니다. 메멘토는 유형식 의미 기억 스키마, 자동 충돌 해결 기구, 시간 버전 관리를 포함하고 있습니다. 이 시스템은 Moorcheh의 정보 이론적 검색 엔진을 사용하여 빠른 검색 속도와 낮은 연산 복잡도를 제공합니다.

에이전트 4월 27일

과학적 진실을 찾기 위한 적대적 실험의 필요성

대규모 언어 모델(LLM) 기반의 에이전트가 과학 데이터 분석을 자동화하고, 과학적 발견을 가속화하는 것으로 보이지만, 이는 또한 가짜 분석의 급속한 생산을 가속화하는 것일 수 있다. 이러한 분석은 선택적으로 선택된 분석을 통해 지원되는 가설 공간을 후보 주장으로 변환할 수 있다. 과학적 지식은 코드의 반복적 축적과 후속 통계적 지원으로 검증되지 않는다. 따라서 에이전트의 도움으로 생성된 비 실험적 주장의 진실성을 평가하기 위해 적대적 실험의 기준을 제안한다.

연구 4월 27일

AI 연구를 위한 새로운 인증 프레임워크: AI 지원 연구의 신뢰성

AI 연구 파이프라인이 점점 더 많은 학술 연구 결과를 생산하고 있습니다. 그러나 이러한 연구 결과는 기존의 피어 리뷰 기준을 충족하는 품질과 새로운 점을 가지고 있습니다. 그러나 출판 시스템은 모든 인간 저자에 대한 UNIVERSAL ASSUMPTION을 가정하고, 자동화된 파이프라인을 통해 생성된 지식의 신뢰성을 평가하는 원칙적인 방법이 없습니다. 이러한 문제를 해결하기 위해, 이 연구는 두 가지 계층 인증 프레임워크를 제안합니다. 이 프레임워크는 지식의 품질 평가와 인간의 기여도를 평가하는 두 가지 별개의 계층으로 나누어, 출판 시스템이 파이프라인으로 생성된 연구 결과를 일관되게 및 투명하게 처리할 수 있습니다.

에이전트 4월 27일

논문 읽고 코드 쓰기: 사회과학 결과의 자기적 재생산

지금까지 대규모 언어 모델(LLM) 에이전트를 사용하여 데이터와 코드에 접근할 수 있는 사회과학 결과를 재생산하는 연구가 있었다. 하지만 만약에 논문에만 있는 방법 설명과 원래 데이터만 주어졌을 때, LLM 에이전트가 결과를 재생산할 수 있는지 궁금했다. 이 연구에서는 논문에서 구조화된 방법 설명을 추출하고, 원래 코드, 결과, 논문을 에이전트가 절대 보지 못하는 정보 분리 하에 리IMPLEMENT에이션을 실행하는 자기적 재생산 시스템을 개발했다. 또한, 에이전트가 재생산한 결과와 원래 결과를 셀 수준으로 비교하고, 불일치의 원인을 추적할 수 있는 오류 분포를 위한 단계를 추가했다. 4개의 에이전트 scaffold와 4개의 LLM를 48개의 논문에 대해 인간이 검증한 재생산 가능성을 평가한 결과, 에이전트가 largley 원래 결과를 재생산할 수 있지만, 모델, scaffold, 논문에 따라 성능이 크게 차이가 난다는 것을 발견했다. 불일치의 원인을 분석한 결과, 에이전트의 오류와 논문 자체의 미분명함이 실패의 원인이라는 것을 밝혔다.

에이전트 4월 27일

자동화된 약물 분자 평가, 검출 및 최적화 위한 MolClaw: 계층적 스킬 아키텍처

약물 분자 평가, 검출 및 최적화라는 복잡한 워크플로우를 처리하기 위해 여러 도구를 조정해야 하는 컴퓨터 약물 발견에서 AI 에이전트가 장기적으로 안정적인 성능을 유지하고 고급 복잡성 시나리오에서 일관되게 성능이 좋지 않다는 문제가 있습니다. MolClaw는 약물 분자 평가, 검출 및 최적화에 대한 자동화된 에이전트를 제시합니다. MolClaw는 30개 이상의 도메인 리소스를 통합하는 3단계 계층적 스킬 아키텍처(총 70개 스킬)가 있어 에이전트가 런타임에 장기적으로 상호 작용할 수 있습니다.

에이전트 4월 27일

의료 영상 처리를 위한 가변성 및 재현성의 도구 기반 에이전트 프레임워크

의료 영상 처리 연구는 실질적인 임상 배포로 전환하고 있는 추세입니다. 이러한 환경에서 분석 방법은 모델 설계를 넘어 데이터셋에 대한 워크플로 구성 및 증명성 추적을 필요로 합니다. 따라서 adaptability(가변성)과 reproducibility(재현성)라는 두 가지 요구 사항이 중심이 됩니다. 본 연구에서는 의료 영상 처리를 위한 도구 기반 에이전트 프레임워크를 제시합니다. 이 프레임워크는 의료 영상 처리에 대한 의미 있는 계층을 추가하여, artifact contract를 통해 중간 및 최종 출력을 공식화하고, 워크플로 상태 및 목적 조건에 따라 모듈러 규칙 라이브러리를 조합하여 구성할 수 있습니다.

연구 4월 27일

수학적 사고가 출현하는지 테스트하는 '수학이 두 번 필요하다'

대규모 언어 모델(LLM)은 수학적 벤치마크에서 놀라운 능력을 보여주지만, 이는 실제 수학적 사고인가 아니면 통계적 패턴 매칭인가에 대한 의문이 남아있다. 기존의 평가 방법은 기존 수학적 관습에 기반한 기호 문제에만 의존하여, 모델의 추상 개념을 첫 번째 원칙에서부터 구축할 수 있는 능력을 파악하기 어렵다. 이 연구에서는 '수학이 두 번 필요하다'라는 새로운 벤치마크를 제안하여, 통신을 통해 수학적 사고가 출현하는지 테스트한다. 인간의 수학적 인식이 정교한 통신의 필요성과 함께 진화했을 것이라는 가설에 의해 мот이브 되며, 두 대상을 포함하여, 이전에 수학적 지식이 없던 두 대원이 시각적으로 기반한 작업을 해결하는 데 수학적 언어를 사용하는 데 도움이 되는 수학적 시스템을 발견할 수 있는지 테스트한다. 기존의 데이터셋과는 달리, 우리의 벤치마크는 미리 정의된 수학적 언어를 배제하고 대신에, 이전에 발견하지 못한 구조와 표현을 발견할 수 있도록 한다. '수학이 두 번 필요하다'는 수학적 사고가 출현하는지 테스트하는 새로운 방법을 제공하여, 대규모 언어 모델(LLM)이나 다른 모델의 수학적 사고 능력을 개발하고 평가하는 데 도움이 될 것이다.