프론티어 언어 모델의 평가 인식 측정에 대한 벤치마크: EvalDetectBench
Frontियर급 대규모 언어 모델들은 자주 평가 중인지를 인식할 수 있으며, 이 능력을 평가 인식(evaluation awareness)이라고 한다. 만약 모델이 평가 시 다른 행동을 보인다면, 이는 평가 결과의 타당성을 침해하고, 이는 현재 AI 안전 프레임워크의 중요한 구성 요소이다. 우리는 EvalDetectBench라는 평가 인식 측정에 대한 공개 pipeline 및 벤치마크를 소개