본문으로 건너뛰기

인간 등급의 자율 연구를 위한 증거链을 통해

자율 연구 요원은 경쟁적인 해결책과 전문적인 서류를 생산하지만, 표면 수준 평가로 인식되지 않는 검증성 실패를 포함한 출력물을 생성합니다. 이는 인용이 조작된 것, 재현 불가능한 점수, 구현과 달리 메소드 설명 등입니다. 이를 해결하기 위해 세 가지 기여를 제시합니다. 첫째, Chain-of-Evidence(증거 chain, CoE)라는 검증성 프레임워크입니다. 이는 모든 주장을 증거 소스로

AI 자동 생성

자율 연구의 한계

자율 연구 요원은 경쟁적인 해결책과 전문적인 서류를 생산하지만, 표면 수준 평가로 인식되지 않는 검증성 실패를 포함한 출력물을 생성합니다. 이는 인용이 조작된 것, 재현 불가능한 점수, 구현과 달리 메소드 설명 등입니다. 이러한 문제는 자율 연구의 신뢰성과 재현성을 저해합니다.

이를 해결하기 위해 세 가지 기여를 제시합니다. 첫째, Chain-of-Evidence(증거 체인, CoE)라는 검증성 프레임워크입니다. 이는 모든 주장을 증거 소스로 추적할 수 있도록 요구합니다. 둘째, ScientistOne이라는 종단-종단 자율 연구 시스템입니다. 이는 문헌 검토, 해결책 발견, 그리고 서류 작성 과정에서 증거 체인을 유지합니다.

ScientistOne의 성과

ScientistOne은 0/337의 인용 오류율, 12/12의 완벽한 점수 검증, 그리고 14/15의 최고 메소드 코드 일치를 달성하며, 다섯 개의 과제에서 인간 전문가 성과를 매치하거나 초과합니다. ScientistOne은 또한 의학 이미지 처리, 세부 인식, 3D 인식, 그리고 대규모 언어 모델링(LLM)을 포함한 여섯 개의 추가 과제에 일반화되며, Parameter Golf에서 최고 성과를 달성하고 MLE-Bench 과제에서 금메달을 획득합니다.

이러한 결과는 ScientistOne이 인간 등급의 자율 연구를 위한 증거 체인을 통해 신뢰성과 재현성을 높일 수 있음을 보여줍니다. 이는 자율 연구의 미래를 밝히는 중요한 발전입니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

연구 3일 전

스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion

스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.

연구 3일 전

기존의 전제 조건자들이 생의학 표준 표 데이터 학습을 개선하는가? 표준 표 데이터 학습 최적화에 대한 실증 연구

최근 구조화된 생물학적 데이터 분석에 있어서 표준화된 기초 모델(tabular foundation model)이 강력한 잠재력을 보인다. 그 중 하나인 TabPFN은 낮은 데이터 표준화 분류 작업에서 효과적인 접근 방식으로 나타났지만, 최적화 및 조건화 전략의 생물학적 세부 튜닝에 대한 영향은 여전히 크게 연구되지 않았다. 본 연구에서, 우리는 59 개의 생물학적 데이터셋(Alzheimer'

연구 6일 전

SAS 비전 트랜스폼러에 기반한 강화된 대비 학습

아티클 번호: 2609.21061v1 발표 유형: 새로운 개요: 합성 어레이 소나(SAS)를 사용하는 자동 목표 식별(AUTR)은 고급 해군 기능을 지원하지만, 깊은 학습은 희소한 목표 이미지를, 배경 잡음 및 인간의 평가를 제한한다. 우리는 바다 속 SAS AUTR을 위한 DINOv3 비전 트랜스포머(ViT) 모델을 3단계의 매개 변수 효율적인 프레임워크로 적응시킨다. 단계 1은 ViT 백

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.