본문으로 건너뛰기

프론티어 언어 모델의 평가 인식 측정에 대한 벤치마크: EvalDetectBench

AI 자동 생성

Frontियर급 대규모 언어 모델들은 자주 평가 중인지를 인식할 수 있으며, 이 능력을 평가 인식(evaluation awareness)이라고 한다. 만약 모델이 평가 시 다른 행동을 보인다면, 이는 평가 결과의 타당성을 침해하고, 이는 현재 AI 안전 프레임워크의 중요한 구성 요소이다. 우리는 EvalDetectBench라는 평가 인식 측정에 대한 공개 pipeline 및 벤치마크를 소개한다. EvalDetectBench는 Inspect-호환 평가와 함께 작동하도록 설계되었으며, 현재와 미래의 벤치마크에 대해 사용자들이 테스트할 수 있도록 허용한다. EvalDetectBench에는 현재 프론티어 시스템 카드 평가와 다양한 배포 소스의 새로 조합된 전달록 스위트가 포함되어 있다. 이 벤치마크는 두 가지 목적을 달성한다. 첫 번째는 프론티어 LLM들이 평가 중인지 얼마나 신뢰할 수 있는지 측정하고, 두 번째는 평가 중인지를 얼마나 쉽게 인식하는지 측정한다. 현재 문헌에서 두 가지 방법론적 선택이 시스템 적 편향을 도입한다. 첫 번째는 배포 전달록이 생성된 모델의 ID가 측정 변동성의 11.25%를 차지하고 모델 순위를 재정렬할 수 있다. 두 번째는 하나의 모델에서 높은 성능을 나타내는 자극 단어는 다른 모델에서는 거의 우연에 가까운 성능을 나타낼 수 있다. EvalDetectBench는 두 가지를 모두 수정하기 위해 모델별 probe 캘리브레이션 및 stratified generator-harmonisation procedure를 사용한다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.