인공지능이 인공지능 과학자를 평가할 수 있나요? 자율 연구 생성 시스템을 위한 자동 멀티 모델 검토를 위한 벤치마킹 연구
AI 과학자 시스템이 자율 연구를 할 수 있는 잠재력을 가지고 있으면 과학적 발견을 크게 촉진할 수 있습니다. 그러나 AI가 생성한 논문의 질을 평가하고 비교하는 것은 여전히 열린 문제입니다. 우리는 과학 논문을 네 가지 핵심 dimension(원래성, 과학적 엄밀성, 명료성, 중요성)에서 평가하는 자동화된 peer-review 시스템을 사용하는 rigourous benchmarking pr