AI 모델 7월 31일
AI 벤치마크의 추론 결합이 불충분한 문제: AI 평가에서의 프로젝트 가능성
AI 벤치마크 결과는 일반적으로 단일 단계에서 중요한 결론을 내리지 않습니다. 평가자는 결과를 다른 경우에 일반화하고, 그것을 능력의 증거로 해석하고, 새로운 작업에 그것을 확장하고, 다른 시스템이나 사이트로 그것을 이전하고, 인간 검토와 하위 결과에 대한 가정과 그것을 결합합니다. 유효성 중심 접근법은 각 주장에 대한 증거가 필요합니다. 이 연구는さらに epistemic 문제를 식별합니다: 하나의 연구의 대상이 다음의 원천이 아님을 의미합니다. 시스템, 집단, 결과 또는 조건은 인터페이스에서 변경될 수 있으며, 공유된 데이터 또는 모델 계통은 독립적인 지원이 의존적임을 나타낼 수 있습니다. 프로젝트 가능성은 관찰된 경우에서 관찰되지 않은 경우로의 한계 확장의 합당성에 대해 질문합니다. Goodman은 확장의 경쟁 문제를 제공하고, 논리 기반 유효성은 그것들을 검증하기 위한 구조를 제공합니다. 이 연구의 독특한 주장은 비합성 원리입니다: 인접한 프로젝션에 대한 지원은 끝점과 가정과 일치하고, 의존성과 불확실성이 전달될 때만 그들의 합성을 허용합니다.