본문으로 건너뛰기

신경과학 데이터에서 발견까지 pipeline에 AI agent를 평가하는 사례 연구

AI 자동 생성

AI 도구는 특히 도메인 전문가가 구현 세부 사항보다는 정확성과 신뢰성을 중시하는 과학 연구 pipe line의 소프트웨어 개발 병목 현상을 자동화하는 데 hứ부한 길을 제공한다. 우리는 가구적 코드 agent의 비서적 연구를 fly optogenetics data-to-discovery pipe line에 대해 수행했다. 우리는 기존 benchmark보다 task가 훨씬 더 크고 dataset이 orders of magnitude 더 큰 evaluation criteria는 도메인 전문가 기준에 기반한 것을 사용했다. 우리는 agent가 여러 pipeline 단계를 해결할 수 있음을 보여주었는데, 이는 stage-level automation이 실현 가능한 것임을 나타낸다. agent의 코드 iteration을 분석한 결과, agent가 struggle하는 가장 큰 문제는 pre-defined criterion이 없을 때 iteration을 수행할 criterion을 정의해야 한다는 것이었다. 대신 agent는 현재 해결책을 평가하기 위해 과학적 판단을 사용해야 했다. 이는 key open challenge이다. 과학적 관행을 반영하여 agent는 중간 출력을 시각적으로 검토하기도 하지만, 그 결과를 해석하거나 적절하게 행동하지 못한다. 종단-종단 pipe line을 올바르게 해결하려면 모든 pipe line 단계에서 성공을 연결해야 하며, 이는 agent의 현재 능력으로는 불가능하다. 우리는 existing benchmark에서 대부분 absent한 challenge를 식별했는데, 그 중 하나가 컴퓨팅 자원 관리와 large held-out data collection에 대한 일반화이다. 마지막으로 우리는 open-ended 문제에 대한 과학적 task와 rigorous evaluation criteria를.construct하는 원칙을 distill했다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 18시간 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.