본문으로 건너뛰기

예측 요원들의 전략적 사고 능력 평가

AI 자동 생성

를 위한 새로운 벤치마크를 제안했다. 이 벤치마크는 1,417 개의 과거 예측 문제를 사용하고 대규모 언어 모델(LLM)으로부터 15만 개의 문서를 사용하여 연구 및 예측을 reproducibly 수행한다. 이 벤치마크는 예측 요원들의 정확도 차이를 0.004 Brier score로 감지할 수 있으며, 연구 및 판단 차이점을 구별할 수 있다.

이 벤치마크를 사용하여, 예측 요원들의 전략적 사고 능력을 평가할 수 있다. 연구 결과, 더 좋은 예측 요원은 주로 자신의 모르는 부분에 대한 pre-mortem 분석과 black swans를 고려하는 점에서 차이가 있다. 전문가인 인간 예측 요원들은 frontier 요원들의 전략적 사고 실패의 주요 원인으로 정치 및 비즈니스 리더들의 동기를 평가하는 것, 그들의 계획을 이행할 가능성을 판단하는 것, 기관의 과정 모델링을 고려하는 것 등을 지적했다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 1일 전

장기 언어_AGENT의 중량 꼬리 메모리 트레이스

장기 예측 언어 agent는 점점 더 외부 메모리를 세계 모델로 고정시키며, 현재의 메모리 시스템은 일반적으로 작업 성공률이나 토큰 비용만으로 평가됩니다. 우리는 메모리 사용의 형태가 누락된 것이며, 한정된 맥락과 반복적인 검색에서 agent 메모리는 작은 핵심에 집중할 수 있으며, 예측 오류가 축적되는 드문 상태를 긴 꼬리에서 남겨둘 수 있음을 주장합니다. 우리는 이 효과를 보존된 꼬리 감

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.