본문으로 건너뛰기

AI 과학자 워크플로우 평가를 위한 프로세스 트레이스: OpenDiscoveryTrace

AI 자동 생성

자율 AI 과학자들을 평가하는 현존하는 벤치마크들은 최종 출력물만 평가하고 그 출력물이 얻어진 추론 과정을 버린다. 이로 인해 과학적 방법론을 감사할 수 없으며, 실패 모드를 진단할 수 없으며, 체계적인 추론과 행운의 추측을 구별할 수 없다. 우리는 **OpenDiscoveryTrace**라는 공개 데이터셋을 제시하는데, 이 데이터셋은 558개의 완전한 AI 과학적 agent 경로를 캡처하여 모델이 추론하는 방식을 기록하는 것 뿐만 아니라 모델이 생성하는 것을 기록한다. 각 경로는 9개의 field를 가진 구조화된 step-by-step trace를 기록하는데, 이 trace에는 생각, 도구 호출, 관찰, 오류, 수정 트리거, 그리고 자체 신뢰도 등이 포함된다. 이 trace는 모델이 124개의 과학적 작업을 수행하는 중에 기록된다. 이 작업은 약물 발견, 재료 과학, 유전체학, 과학 문헌 분석 등이 포함된다. 이 데이터셋은 7개의 모델을 포함하는데, 3개의 선두 모델(GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro)와 4개의 공개 무게 모델(Qwen2.5-7B, Mistral-7B-v0.3, Phi-3.5-mini, Qwen2.5-1.5B) 그리고 60개의 라이브 리트리벌 변형 경로가 포함된다. 363개의 대규모 언어 모델(LLM)으로 평가된 경로에 대한 초기 분석 결과, 과정 trace는 출력물만 평가할 때는 보이지 않는 행동 차이를 드러낸다: 모든 3개의 선두 모델은 성공률이 비슷하다(84-89%)지만, Claude Opus 4.6은 GPT-5.4보다 30배 더 많은 오류를 발생시킨다(2.5 vs 0.08 per trajectory, p < 0.0001, Cliff's δ = 0.613). 또한 Claude Opus 4.6의 오류 프로파일은 GPT-5.4와 달리 양적으로 다르며, 66.7%의 도구 오용과 83.6%의 추론 오류가 포함된다. 우리는 5개의 벤치마크 작업을 정의하고, 로지스틱 회귀, 랜덤 포레스트, LSTM, Transformer 모델의 베이스라인을 정의한다. 데이터셋, trace schema, agent harness, 그리고 벤치마크 정의는 CC BY 4.0을 통해 공개되며, 과정을 기반으로 한 평가, 과학적 agent 감사, 그리고 AI 관리에 대한 연구를 지원한다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 16시간 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.